Обзор Hy-MT2: Новый AI от Tencent объемом 440 МБ работает полностью офлайн и может заменить Google Translate
Tencent Hy-MT2: локальный AI-переводчик объемом 440 МБ, который может заменить Google Translate! Обзор, тесты и как его установить.
Перевод конфиденциальных данных через облачные API является дорогостоящим и трудоемким процессом. Tencent представила локальную альтернативу, работающую полностью в автономном режиме. В данном обзоре рассматриваются ключевые детали, результаты тестов и практическое применение модели Hy-MT2.
Введение в Hy-MT2
Hy-MT2 — это новая модель перевода от Tencent, разработанная для локальной работы на компьютере пользователя. Основное внимание уделяется высокоскоростной обработке, позволяющей переводить множество языков локально и обрабатывать документы быстрее многих коммерческих аналогов. Модель построена на архитектуре, оптимизированной для следования инструкциям и точного соблюдения правил. Лицензия позволяет использовать модель в коммерческих проектах без ограничений.
Варианты модели и требования к оборудованию
Модель Hy-MT2 доступна в различных размерах:
- 2 миллиарда параметров (легкая версия): Минимальные требования к обработке, может работать на центральном процессоре (CPU). Минимальный объем памяти составляет 440 МБ.
- 30 миллиардов параметров (серверный вариант): Активирует 3 миллиарда параметров для конкретной задачи.
Для 1.8 миллиарда параметров с 4-битной квантизацией требуется около 1.2 ГБ видеопамяти (VRAM). Это делает модель доступной для работы на базовых компьютерах и даже на CPU.
Архитектура и процесс работы
Исходный файл модели был сжат с 3.6 ГБ до 440 МБ, что снизило потребление памяти и ускорило генерацию. Процесс работы модели включает следующие этапы:
- Ввод данных: Принимаются стандартные текстовые файлы или данные, извлеченные с помощью OCR из изображений.
- Применение правил форматирования: Пользователь может предоставить собственный словарь или правила, которые модель будет учитывать.
- Обработка: Модель с параметрами 1.8 миллиарда или 30 миллиардов обрабатывает данные.
- Вывод: Формируется чистый диалоговый текст в запрошенном формате перевода.
Такой подход позволяет получать структурированные JSON-файлы, что удобно для интерфейсов приложений и предотвращает ошибки форматирования.
Практическое применение
Hy-MT2 может использоваться в различных сценариях:
- Редакторы видео: Перевод субтитров с сохранением исходных временных меток, обеспечивая синхронизацию с видео.
- Интеграция с VLM: Совместная работа с моделями типа LLaVA 1.5 2B или LiquidAI's LFM-2.5 для перевода текста, извлеченного из скриншотов.
- Технический перевод: Возможность принудительного использования специфических терминов, что стандартные модели часто упускают.
- Развертывание на Edge-устройствах: Низкое потребление памяти (менее 0.5 ГБ ОЗУ) позволяет использовать модель на мобильных устройствах с поддержкой платформ Apple, Qualcomm, MediaTek.
- Конфиденциальность данных: Перевод осуществляется локально, что гарантирует сохранность конфиденциальных файлов, таких как блоки кода и макеты таблиц, без их искажения.
- Экономия средств: Отсутствие облачных вычислений исключает дополнительные расходы.
Результаты тестирования
Модель Hy-MT2 демонстрирует высокие показатели:
- Первое место в бенчмарках по следованию инструкциям: Охвачено 33 языка и 5 региональных диалектов.
- Превосходство над облачными сервисами: Компактная версия (1.8 миллиарда параметров) с использованием менее 0.5 ГБ памяти опережает Microsoft Translate и DeepL API, достигая 88% в тестах.
- 30-миллиардная модель: Достигает 94% производительности, являясь передовой моделью машинного перевода с открытым исходным кодом.
Практический тест: перевод субтитров
В рамках тестирования была использована 1.8-миллиардная модель с 4-битной квантизацией. Файл субтитров (SRT) предыдущего видео объемом около 1 минуты был переведен на хинди и испанский языки.
Процесс:
- Загрузка GGUF-файла модели в директорию Ollama.
- Регистрация модели с помощью команды Ollama.
- Извлечение текста и временных меток из SRT-файла.
- Формирование промпта для модели с указанием перевода на целевые языки (хинди - HI, испанский - ES).
- Отправка промпта на локальный URL Ollama.
- Сохранение переведенных файлов и метрик производительности (количество блоков, символов, время выполнения, скорость генерации).
Результаты:
- Метрики: Обработано 28 блоков, 3000 символов. Общее время выполнения составило 6 секунд. Средняя задержка на блок — 0.2 секунды. Общее время перевода на оба языка — 2-3 секунды.
- Перевод на хинди: Модель успешно перевела основную часть текста, однако некоторые технические термины, такие как "lightweight system", остались без перевода или были транслитерированы.
- Перевод на испанский: Результаты перевода на испанский язык были представлены с сохранением временных меток.
Основным преимуществом модели является высокая скорость генерации, что делает ее полезной для локальных рабочих процессов, требующих низкой задержки.
Требования к оборудованию для различных вариантов
- 1.8 миллиарда параметров, 16-битная квантизация: Требуется 4 ГБ VRAM (подходит для RTX 3050).
- Более низкие битовые квантизации (8-бит, 2-бит, 1.25-бит): Снижают размер модели и потребление памяти.
- 30 миллиардов параметров (активируется 3 миллиарда): Размер модели 14 ГБ, потребление VRAM 8 ГБ (требуется высокопроизводительный GPU или Mac Studio).
Даже при конфигурации с 8 ГБ ОЗУ и 4 ГБ VRAM, при интеграции с моделями зрения, достигается задержка менее одной секунды на предложение.
Ограничения
- Требуется среда выполнения: Для запуска модели необходим соответствующий движок.
- Интеграция Ollama: Для сильно сжатых версий требуется настройка интеграции с Ollama.
- Редкие диалекты: 1.8-миллиардная модель лучше справляется с распространенными языками. Для редких диалектов рекомендуется 30-миллиардная версия для более плавного перевода.
Заключение
Hy-MT2 от Tencent представляет собой мощное решение для локального машинного перевода, предлагающее высокую скорость, низкие требования к ресурсам и конфиденциальность данных. Компактные размеры и возможность работы на базовом оборудовании делают ее привлекательной альтернативой облачным сервисам.
Введение в Hy-MT2
Представлена модель Hy-MT2 от Tencent, локальная альтернатива облачным сервисам перевода, работающая полностью офлайн. Серия "Build with AI" фокусируется на бесплатных локальных инструментах ИИ.
- Tencent выпустила локальную альтернативу облачным API для перевода.
- Модель Hy-MT2 работает полностью офлайн.
- Серия "Build with AI" посвящена локальным бесплатным инструментам ИИ.
Архитектура и возможности Hy-MT2
Hy-MT2 — это новая модель перевода от Tencent, оптимизированная для высокой скорости и работы на локальных машинах. Она поддерживает коммерческое использование и доступна в различных размерах, от 2 до 30 миллиардов параметров, с минимальными требованиями к памяти (440 МБ для самой легкой версии).
- Hy-MT2 фокусируется на высокоскоростной обработке и локальном переводе.
- Модель оптимизирована для следования инструкциям и точной обработки правил.
- Лицензия позволяет коммерческое использование без ограничений.
- Доступны версии с 2 и 30 миллиардами параметров.
- Минимальный размер модели — 440 МБ, требующий около 0.5 ГБ ОЗУ.
- Поддерживает перевод между основными мировыми языками и региональными диалектами.
Загрузка модели Hy-MT2
Процесс загрузки Hy-MT2 включает выбор версии (например, 1.8B 4-bit квантизации) и загрузку GGUF файла с Hugging Face. Расчет требуемой VRAM для модели 1.8B 4-bit составляет около 1.2 ГБ.
- Модель доступна на Hugging Face в сжатых TGZ файлах.
- Для 1.8B параметров доступны версии 4-bit, 6-bit и 8-bit квантизации.
- Расчет VRAM для 1.8B 4-bit: (1.8 * 4) / 8 + 1.2 = 1.2 ГБ.
- Загрузка GGUF файла осуществляется с помощью команды в терминале.
Архитектурный конвейер Hy-MT2
Архитектура Hy-MT2 включает сжатие исходного файла до 440 МБ, обработку текста или OCR-данных, применение правил форматирования и перевод с использованием движка на 1.8 или 30 миллиардов параметров. Результат — структурированный JSON.
- Исходный файл сжат с 3.6 ГБ до 440 МБ.
- Этапы обработки: ввод данных, применение правил форматирования, перевод.
- Поддерживается ввод стандартного текста и OCR-данных.
- Возможность использования пользовательских словарей.
- Выходной формат — структурированный JSON, полезный для интерфейсов приложений.
Практическое применение Hy-MT2
Hy-MT2 имеет множество практических применений: перевод субтитров с сохранением таймингов, интеграция с моделями зрения для перевода текста на изображениях, использование специфических терминов и развертывание на edge-устройствах.
- Идеально подходит для видеоредакторов: перевод субтитров с сохранением таймингов.
- Может использоваться с моделями зрения (например, LLaVA 3.5 2B) для перевода текста с изображений.
- Позволяет использовать специфические технические термины.
- Возможно развертывание на edge-устройствах (мобильные телефоны) благодаря низкому потреблению памяти (<0.5 ГБ ОЗУ).
- Поддерживает различные платформы: Apple, Qualcomm, MediaTek.
- Сохраняет конфиденциальность данных, так как все работает локально.
Результаты тестирования Hy-MT2
Hy-MT2 занимает первое место в бенчмарках по следованию инструкциям среди 33 языков. Версия 1.8B превосходит Microsoft Translate и DeepL API по производительности при использовании менее 0.5 ГБ памяти.
- Модель занимает первое место в бенчмарках по следованию инструкциям (33 языка + 5 диалектов).
- Малая версия (1.8B) превосходит облачные аналоги (Microsoft Translate, DeepL API).
- Версия 1.8B достигает 88% производительности, используя <0.5 ГБ памяти.
- Большая версия (30B) достигает 94% производительности, являясь state-of-the-art моделью.
Практическая демонстрация перевода
Регистрация GGUF файла в Ollama выполняется одной командой. Для демонстрации используется перевод субтитров предыдущего видео (1 минута) на хинди и испанский.
- GGUF файл регистрируется в Ollama с помощью одной команды.
- Демонстрация перевода субтитров предыдущего видео (1 минута).
- Целевые языки: хинди (HI) и испанский (ES).
- Входной файл: SRT субтитры на английском.
- Выходные файлы: переведенный текст и метрики.
Аппаратные требования и производительность
Аппаратные требования варьируются: для 1.8B 16-bit требуется 4 ГБ VRAM (RTX 3050), для 30B — 8 ГБ VRAM. Модель обеспечивает субсекундную задержку даже при интеграции с моделями зрения.
- 1.8B 16-bit: требуется 4 ГБ VRAM (например, RTX 3050).
- 1.8B с пониженной квантизацией (8-bit, 2-bit, 1.25-bit) требует меньше памяти.
- 30B (активирует 3B параметров): требуется 8 ГБ VRAM (высокопроизводительные GPU или Mac Studio).
- Обеспечивает субсекундную задержку при интеграции с моделями зрения.
- Требуется среда выполнения (runtime engine) и настройка Ollama для сжатых версий.
Ограничения и результаты перевода
Малая версия Hy-MT2 (1.8B) справляется с большинством языков, но для редких диалектов рекомендуется 30B версия. Тестирование показало перевод 3000 символов за 6 секунд, с средней задержкой блока 0.2 секунды.
- 1.8B версия подходит для большинства распространенных языков.
- 30B версия рекомендуется для редких диалектов.
- Тестирование: 3000 символов переведены за 6 секунд.
- Средняя задержка блока: 0.2 секунды.
- Общее время перевода для 1-минутного видео: 2-3 секунды.
Анализ результатов перевода
Результаты перевода на хинди и испанский показали, что модель хорошо справляется с простыми словами, но иногда оставляет английские термины. Главное преимущество — высокая скорость локального перевода.
- Перевод на хинди: модель справляется с простыми словами, но может оставлять английские термины (например, 'system').
- Перевод на испанский: предоставлен для проверки пользователями.
- Сохраняются тайминги и полная длина видео.
- Основное преимущество: высокая скорость генерации (2-3 секунды для 1-минутного видео).
- Идеально для локальных рабочих процессов с низкой задержкой.
Заключение и дальнейшие шаги
Для начала работы с Hy-MT2 доступны файлы README и код по первой ссылке в описании. Автор предлагает делиться идеями для новых AI-инструментов и моделей.
- Инструкции по установке и модификации проекта доступны в файлах README и коде.
- Первая ссылка в описании содержит пошаговые инструкции.
- Автор призывает делиться идеями для будущих видео и моделей ИИ.
