Parakeet Redux: AI от Nvidia размером 178 МБ превосходит Whisper, работая в 113 раз быстрее на CPU!
AI от Nvidia размером 178 МБ работает на CPU в 113 раз быстрее Whisper! Создайте свой локальный транскрибатор.
Обработка длинных аудио- или видеофайлов часто замедляет работу ноутбука, однако Parakeet представила движок объемом менее 200 МБ, который может работать на потребительских процессорах, обеспечивая при этом более чем 100-кратное увеличение скорости. В рамках серии "Build with AI" представлен проект локального транскрибатора, способного преобразовывать записи встреч и подкастов непосредственно в текстовые файлы.
Основное внимание уделяется Nvidia Parakeet EDocks, новой системе распознавания речи, которая значительно уменьшает объем обработки аудио, предоставляя полные возможности транскрипции в компактном файле. Система использует сжатую математическую структуру с 1,58 битами и поддерживает более двух десятков языков. Ключевым преимуществом является 113-кратное увеличение скорости при работе исключительно на центральных процессорах (CPU). Это позволяет обрабатывать 60-минутную запись примерно за полминуты, что существенно сокращает время ожидания в повседневных рабочих процессах.
Разработчики оптимизировали модель, сократив объем загружаемых данных, что обеспечивает более высокие результаты при использовании меньшего объема ресурсов. Секрет эффективности заключается в упрощении весов нейронной сети до трех основных значений: -1, 0 или +1. Это изменение устраняет необходимость в дорогостоящих графических процессорах (GPU) и позволяет системе автоматически определять моменты речи, выполняя сегментацию аудио.
Установка и настройка
Для создания локального транскрибатора требуется установка библиотеки FFmpeg для преобразования различных форматов файлов в формат WAV, понятный модели. Для пользователей Windows команда для установки FFmpeg выглядит следующим образом:
# Пример команды для установки FFmpeg (для Windows)
# (Конкретная команда может отличаться в зависимости от дистрибутива и способа установки)
winget install ffmpeg
Далее необходимо установить библиотеки для разработки приложения:
- Streamlit: для создания пользовательского интерфейса (дашборда).
- Moon Reader: для загрузки модели Parakeet Redux.
- NumPy: для выполнения операций с массивами в Python.
Команда для установки этих библиотек:
pip install streamlit moon-reader numpy
Разработка приложения
Приложение будет иметь заголовок "Parakeet Redux Local Transcriber". Макет может быть настроен для настольных компьютеров (wide) или мобильных устройств (centered).
Процесс обработки входного файла включает следующие шаги:
- Преобразование в WAV: Входной файл (аудио или видео) преобразуется в формат WAV с использованием FFmpeg. Время выполнения этой операции отслеживается с помощью библиотеки
timeв Python. Команда FFmpeg выполняется с помощью библиотекиsubprocess. - Загрузка модели Parakeet Redux: Модель Parakeet Redux загружается с использованием библиотеки Moon Reader. При первом запуске загрузка модели объемом около 200 МБ займет некоторое время.
- Транскрибация: Загруженная модель используется для транскрибации аудио. Процесс включает загрузку модели распознавания речи (
speech_model.load()) и последующую транскрибацию (speech_model.transcribe()). - Отображение результатов: Отображается время, затраченное на извлечение аудио, время транскрибации ИИ и общее время выполнения.
- Сегментация и форматирование: Модель автоматически определяет сегменты аудио, предоставляя время начала и окончания каждого сегмента, а также транскрибированный текст. Эти данные форматируются и сохраняются в переменной
body_transcript, которая затем записывается в выходной файл в формате Markdown. Пользователь также может скачать этот файл.
Демонстрация работы
Приложение запускается командой streamlit run <имя_файла_приложения>.py. Для тестирования используется короткое видео продолжительностью около 1 минуты.
Принцип работы движка
- Входные данные: Сырое аудио подается в конвейер обработки.
- Преобразование: FFmpeg преобразует файл в формат аудио.
- Удаление тишины: Модель Parakeet удаляет тихие участки для экономии вычислительных ресурсов.
- Сжатое кодирование: Сжатый движок преобразует оставшиеся вокальные частоты.
- Выходные данные: Точные слова с временными метками для синхронизации субтитров.
При локальной транскрибации использование памяти снижается на 85% благодаря упрощенной структуре данных. Размер файла составляет всего 178 МБ, что исключает необходимость в дорогих GPU. Модель автоматически обрабатывает знаки препинания и цифры. Стандартные процессоры могут выполнять вычисления нативно, но наличие GPU может ускорить процесс. Возможно пакетное сканирование папок с медиафайлами.
Сравнение и производительность
По результатам тестирования на 25 языках модель Parakeet Redux демонстрирует более низкий процент ошибок по сравнению с базовой версией, составляя около 10% ошибок при размере 200 МБ против 1,2 ГБ у оригинальной модели. В случае длинных подкастов процент ошибок также ниже, с улучшением производительности на 0,2% по сравнению с оригинальной версией Parakeet.
Что касается скорости работы на CPU, оригинальный Parakeet показывал 45-кратное увеличение скорости, тогда как Parakeet Redux благодаря фотонной архитектуре обеспечивает 113-кратное увеличение. По сравнению с базовой моделью, скорость выполнения увеличивается в 2,5 раза. Размер загрузки сокращен с 1,2 ГБ до 178 МБ, что уменьшает занимаемое место на диске на 85%.
Результаты тестирования
При обработке 1-минутного видеофайла:
- Извлечение аудио заняло 0,4 секунды.
- Преобразование аудио в текст заняло 3 секунды.
- Общее время выполнения конвейера составило 3 секунды.
Пример транскрибированного текста: "The China has once again returned the global tech markets as Deep Sea officially released their new 4.1 flash model." Отмечается, что названия компаний, такие как "Deep Sea" или "GPT", могут транскрибироваться некорректно, если модель не была обучена на этих конкретных терминах. Однако обычные английские слова распознаются точно.
Практическое применение
Модель может использоваться в различных сценариях:
- Транскрибатор встреч: Обеспечивает 100% конфиденциальность данных, обрабатывая файлы локально.
- База данных аудиозаписей: Преобразует разрозненные аудиозаметки в текстовую базу данных для поиска информации.
- Анализ образовательных видео: Встроенный детектор тишины позволяет разбивать длинные видео на логические сегменты.
- Обработка мультиязычных аудио: Позволяет обрабатывать аудиофайлы на смешанных языках непосредственно на устройстве.
- Инструменты голосового управления: Разработчики могут создавать инструменты командной строки с минимальной задержкой для голосового взаимодействия с кодом.
- Распределение нагрузки: Передача задач обработки на CPU освобождает GPU для работы с текстовыми моделями.
Преимущества и ограничения
Преимущества:
- Простая установка одной командой в терминале.
- Автоматическая сегментация длинного аудио по паузам.
- Фоновая обработка, минимизирующая нагрузку на системную память и позволяющая многозадачность без замедления работы.
Ограничения:
- Сильные фоновые шумы могут влиять на точность модели. Требуются чистые записи.
- Необходимость форматирования аудиофайлов до определенной частоты дискретизации модели с использованием FFmpeg.
Parakeet Redux представляет собой ультралегкий приватный движок распознавания речи, работающий полностью офлайн на базовых CPU. Для получения руководства по локальной настройке и коду проекта рекомендуется обратиться к первой ссылке в описании и закрепленных комментариях, где содержится подробная документация и инструкции по настройке.
Введение в Parakeet Redux
Представлена новая AI-модель Parakeet Redux от Nvidia, которая значительно уменьшает размер и повышает скорость обработки аудио. Модель размером менее 200 МБ работает на обычных CPU, обеспечивая более чем 100-кратное ускорение. Автор планирует создать локальный транскрибатор для встреч и подкастов.
- Parakeet Redux — AI-модель для обработки аудио размером менее 200 МБ.
- Работает на потребительских CPU с ускорением более чем в 100 раз.
- Позволяет создавать локальные транскрибаторы для аудио и видео.
Технические особенности и преимущества Parakeet Redux
Parakeet Redux использует сжатую математическую структуру (1.58 бит) и поддерживает более двух десятков языков. Ключевая особенность — 113-кратное ускорение на CPU, позволяющее обрабатывать 60-минутное аудио за полминуты. Разработчики оптимизировали модель, упростив веса до -1, 0 или +1, что устраняет необходимость в дорогих видеокартах и позволяет автоматически сегментировать аудио.
- Использует сжатую математическую структуру 1.58 бит.
- Поддерживает более 20 языковых диалектов.
- Обеспечивает 113-кратное ускорение на CPU.
- Веса модели упрощены до -1, 0, +1, что исключает потребность в GPU.
- Автоматически сегментирует аудио, определяя речь.
Установка необходимых инструментов
Для создания локального транскрибатора необходимы библиотеки FFmpeg (для конвертации форматов), Streamlit (для дашборда), Moon Reader (для загрузки модели Parakeet Redux) и NumPy (для операций с массивами). Процесс установки включает скачивание FFmpeg и установку Python-библиотек.
- Необходимые библиотеки: FFmpeg, Streamlit, Moon Reader, NumPy.
- FFmpeg конвертирует аудио/видео в формат, понятный модели.
- Streamlit используется для создания пользовательского интерфейса.
- Moon Reader загружает модель Parakeet Redux.
- NumPy помогает в обработке данных.
Создание и запуск локального транскрибатора
Создается дашборд с использованием Streamlit, который позволяет загружать аудио/видео файлы. Файлы конвертируются в формат WAV с помощью FFmpeg. Затем модель Parakeet Redux загружается и используется для транскрипции. Отображается время обработки аудио, время транскрипции и общее время. Результаты сохраняются в виде markdown-файла.
- Дашборд позволяет загружать аудио/видео файлы.
- Конвертация в WAV с помощью FFmpeg.
- Загрузка и использование модели Parakeet Redux для транскрипции.
- Отображение времени обработки и транскрипции.
- Результаты сохраняются в markdown-файле для скачивания.
Принцип работы и оптимизация Parakeet Redux
Parakeet Redux обрабатывает аудио, удаляя тишину для экономии ресурсов. Сжатый движок переводит звуковые частоты, выдавая точные слова с временными метками. Использование упрощенной структуры данных снижает потребление памяти на 85%. Модель не требует дорогих GPU и корректно обрабатывает знаки препинания и цифры.
- Модель удаляет тишину для оптимизации.
- Выдает точные слова с временными метками.
- Снижает потребление памяти на 85%.
- Не требует дорогих видеокарт.
- Корректно обрабатывает пунктуацию и цифры.
Сравнительные характеристики и бенчмарки
Сравнение Parakeet Redux с базовой версией показывает снижение частоты ошибок (около 10% против неизвестного у базовой) при значительно меньшем размере (200 МБ против 1.2 ГБ). Ускорение на CPU увеличено до 113 раз (против 45 раз у базовой) благодаря фотонной архитектуре. Общий размер модели уменьшен на 85%.
- Снижение частоты ошибок на 25-языковом тесте.
- Размер модели: 200 МБ против 1.2 ГБ у оригинала.
- Ускорение на CPU: 113x против 45x у оригинала.
- Уменьшение занимаемого места на диске на 85%.
Результаты тестирования и примеры транскрипции
Тестирование на 1-минутном видео показало впечатляющие результаты: извлечение аудио за 0.4 сек, транскрипция за 3 сек, общее время — 3 сек. Модель точно транскрибирует обычные слова, но может ошибаться с названиями компаний (например, Deep Sea, GPT, Cloud 5). Рекомендуется проверять и корректировать такие названия.
- Обработка 1-минутного видео заняла всего 3 секунды.
- Точная транскрипция обычных английских слов.
- Возможны ошибки в названиях компаний и специфических терминах.
- Необходима проверка и коррекция имен собственных.
Практические сценарии использования
Parakeet Redux идеально подходит для создания приватных транскрибаторов встреч, преобразования голосовых заметок в текстовую базу данных, разбивки длинных видео на сегменты и обработки аудио на смешанных языках. Разработчики могут использовать его для создания инструментов с голосовым управлением.
- Создание приватных транскрибаторов встреч.
- Преобразование голосовых заметок в текстовую базу данных.
- Сегментация длинных образовательных видео.
- Обработка аудио на смешанных языках.
- Разработка инструментов с голосовым управлением.
Преимущества и ограничения Parakeet Redux
Преимущества: простая установка (одна команда), автоматическая сегментация аудио, фоновая обработка, не нагружающая систему. Ограничения: чувствительность к фоновому шуму и музыке, необходимость форматирования аудиофайлов под определенную частоту дискретизации с помощью FFmpeg.
- Простая установка одной командой.
- Автоматическая сегментация аудио по паузам.
- Фоновая обработка не нагружает систему.
- Чувствительность к фоновому шуму.
- Необходимость предварительного форматирования аудио с помощью FFmpeg.
Заключение и перспективы
Parakeet Redux — это ультралегкий, приватный AI-движок для речи, работающий офлайн на базовых CPU. Он предоставляет разработчикам возможность создавать собственные решения для транскрипции. Доступны инструкции по установке и файлы кода для кастомизации.
- Ультралегкий, приватный AI-движок для речи.
- Работает полностью офлайн на базовых CPU.
- Предоставляет разработчикам гибкость для кастомизации.
- Доступны инструкции по установке и файлы кода.
