NVIDIA NeMo Speech (Parakeet, Canary)
Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.
Основная информация
Технические характеристики
- Разработчик
- NVIDIA
- Лицензия
- Фреймворк — Apache License 2.0; веса Parakeet v3 и Canary v2 — CC-BY-4.0; Nemotron 3.5 ASR — OpenMDW-1.1
- Открытый исходный код
- Да — код фреймворка на GitHub, веса моделей на Hugging Face
- Коммерческое использование
- Parakeet v3 и Canary v2: «ready for commercial/non-commercial use»; Nemotron 3.5 ASR: «ready for commercial use»
- AI-модели
- Parakeet TDT 0.6B v3, Canary 1B v2, Nemotron 3.5 ASR Streaming 0.6B
- Размеры модели
- Parakeet v3 — 600 млн параметров; Canary v2 — 978 млн; Nemotron 3.5 ASR — 600 млн
- Языки распознавания
- Parakeet v3 и Canary v2 — 25 европейских языков, в том числе русский и украинский; Nemotron 3.5 ASR — 40 языковых локалей, в том числе ru-RU
- Точность распознавания (WER)
- Русский: Parakeet v3 — 5,51 % (FLEURS), 3,00 % (CoVoST); Canary v2 — 6,90 % (FLEURS test), 5,14 % (CoVoST2 test); без учёта пунктуации и регистра
- Определение языка
- Да — Parakeet v3 определяет язык записи сама
- Автопунктуация
- Да — пунктуация и заглавные буквы в выводе моделей
- Тайм-коды
- Слов и сегментов; у перевода Canary v2 — сегментов
- Перевод речи (Speech Translation)
- Canary v2 — с английского на 24 языка и с 24 языков на английский
- Streaming-режим
- Nemotron 3.5 ASR Streaming — задержка настраивается от 80 мс до 1 с
- Максимальная длительность файла
- Parakeet v3: до 24 минут целиком на A100 80 ГБ или до 3 часов с локальным вниманием
- Требования к железу
- GPU NVIDIA рекомендован для распознавания и обязателен для обучения; Parakeet v3 — Volta, Ampere, Hopper, Blackwell и не меньше 2 ГБ памяти; Canary v2 — Ampere, Hopper, Blackwell и не меньше 6 ГБ
- Платформы
- Linux
- Требования
- Python 3.12 или новее, PyTorch 2.7 или новее
- Команда установки
- pip install 'nemo-toolkit[asr,tts]'
- Docker-образ
- nvcr.io/nvidia/nemo-speech:26.07.00 (каталог NGC)
- Дообучение моделей
- Да — дообучение моделей распознавания на своих данных
- Разделение по спикерам
- Да — модули диаризации в составе фреймворка
- Последняя версия
- v3.0.0 (NVIDIA NeMo Speech 3.0) от 07.08.2026
- Дата релиза
- Parakeet v3 и Canary v2 — 14.08.2025; Nemotron 3.5 ASR Streaming — июнь 2026
- Репозиторий
- GitHub: NVIDIA-NeMo/Speech (прежнее имя NVIDIA/NeMo)
Обзор NVIDIA NeMo Speech (Parakeet, Canary)
Что такое NeMo Speech
NeMo Speech — открытый фреймворк NVIDIA для исследователей и разработчиков на PyTorch, которые работают с распознаванием речи, синтезом и речевыми языковыми моделями. В 2026 году репозиторий NVIDIA/NeMo переименовали в NVIDIA-NeMo/Speech и сосредоточили на речи, а языковые, визуальные и прочие модули вынесли в отдельные репозитории. Версия 3.0 от 7 августа 2026 года — первый крупный релиз после разделения. Сам фреймворк распространяется под Apache License 2.0, готовые модели лежат на Hugging Face со своими лицензиями.
Модели с поддержкой русского языка
- Parakeet TDT 0.6B v3 — 600 млн параметров, 25 европейских языков, в том числе русский и украинский. Сама определяет язык записи, ставит знаки препинания и заглавные буквы, выдаёт таймкоды слов и сегментов. Лицензия CC-BY-4.0, выпущена 14 августа 2025 года
- Canary 1B v2 — 978 млн параметров, те же 25 языков: распознаёт речь и переводит её с английского на 24 языка и с 24 языков на английский, таймкоды сегментов есть и у перевода. Лицензия CC-BY-4.0, выпущена 14 августа 2025 года
- Nemotron 3.5 ASR Streaming 0.6B — потоковая модель на 40 языковых локалей с настраиваемой задержкой от 80 мс до 1 с; русский входит в группу «готовых к транскрибации». Лицензия OpenMDW-1.1, выпущена в июне 2026 года
Обе модели выпуска 2025 года NVIDIA помечает как готовые к коммерческому и некоммерческому использованию; про потоковую сказано «ready for commercial use».
Точность на русском
В карточках моделей WER считается без учёта пунктуации и регистра. Parakeet v3 на русском: 5,51 % на FLEURS и 3,00 % на CoVoST (жадное декодирование без внешней языковой модели). Canary 1B v2: 6,90 % на тестовой части FLEURS и 5,14 % на CoVoST2. Это публичные наборы чтения и озвучки; на звонках и шумной записи цифры будут другими — для телефонии модель стоит проверить на своих данных.
Что нужно для запуска
Фреймворку нужны Python 3.12 или новее и PyTorch 2.7 или новее. Видеокарта NVIDIA с CUDA обязательна для обучения и рекомендована для распознавания. В карточке Parakeet v3 указаны архитектуры GPU Volta, Ampere, Hopper и Blackwell, в карточке Canary v2 — Ampere, Hopper и Blackwell; ОС в обеих — Linux. Для загрузки Parakeet v3 нужно не меньше 2 ГБ памяти, для Canary v2 — не меньше 6 ГБ. Parakeet v3 обрабатывает до 24 минут записи целиком на A100 80 ГБ или до 3 часов в режиме локального внимания.
Установить можно из исходников через uv, пакетом nemo-toolkit из PyPI поверх своей сборки PyTorch или готовым Docker-образом nemo-speech из каталога NGC. Каталог NGC и реестр образов nvcr.io с российского IP отвечают 403, GitHub и Hugging Face открываются; образ можно собрать самостоятельно по Dockerfile из репозитория.
Что ещё есть во фреймворке
Кроме распознавания — синтез речи, диаризация и детектор голосовой активности, дообучение моделей на своих данных, подсказка фраз для точного распознавания терминов. В версии 3.0 NVIDIA удалила 800 тысяч строк устаревшего кода и неподдерживаемые модели, а установку перевела на менеджер пакетов uv.
Плюсы и минусы NVIDIA NeMo Speech (Parakeet, Canary)
+Преимущества
- ✓Русский язык поддерживается в готовых моделях — без дообучения
- ✓Модели выпуска 2025 года прямо разрешены для коммерческого использования (CC-BY-4.0)
- ✓WER для русского опубликован по открытым наборам FLEURS и CoVoST
- ✓Пунктуация и таймкоды — без отдельной модели
- ✓Фреймворк активно развивается: релиз 3.0 вышел в августе 2026 года
- ✓Одна кодовая база для распознавания, перевода, синтеза и диаризации
−Недостатки
- ✗Рассчитан на видеокарты NVIDIA и Linux: GPU с CUDA обязателен для обучения и рекомендован для распознавания
- ✗Каталог NGC и реестр nvcr.io с готовым Docker-образом с российского IP отвечают 403 — остаются pip и сборка из исходников
- ✗Нужен свежий стек: Python 3.12 и PyTorch 2.7 или новее
- ✗Порог входа выше, чем у готовых API: нужен опыт PyTorch и DevOps
- ✗CC-BY-4.0 требует указывать авторство NVIDIA при использовании моделей
- ✗Цифры WER получены на публичных наборах чтения, для звонков модель нужно проверять на своих данных
Сценарии использования NVIDIA NeMo Speech (Parakeet, Canary)
Расшифровка записей на своём GPU-сервере
Запустить Parakeet v3 на сервере с видеокартой NVIDIA и получать русский текст сразу с пунктуацией и таймкодами слов, не отправляя записи во внешнее облако.
Субтитры с переводом
Распознать русскую речь моделью Canary v2 и сразу получить английский перевод с таймкодами сегментов для субтитров.
Голосовой агент реального времени
Поставить потоковую Nemotron 3.5 ASR и подобрать задержку от 80 мс до 1 с под сценарий голосового бота.
Дообучение под свою предметную область
Взять готовые веса и дообучить модель на записях своего колл-центра или отраслевой лексике средствами фреймворка.
Исследования и эксперименты с речевыми моделями
Использовать фреймворк для обучения собственных моделей распознавания, синтеза и речевых языковых моделей на PyTorch.
Отзывы о NVIDIA NeMo Speech (Parakeet, Canary)
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о NVIDIA NeMo Speech (Parakeet, Canary)
?Какие модели NeMo понимают русский язык?
Parakeet TDT 0.6B v3 и Canary 1B v2 — обе поддерживают 25 европейских языков, в том числе русский и украинский. Потоковая Nemotron 3.5 ASR Streaming 0.6B поддерживает 40 языковых локалей, и русский входит в группу «готовых к транскрибации» без дообучения.
?Насколько точно Parakeet распознаёт русскую речь?
По карточке модели у Parakeet v3 на русском WER 5,51 % на наборе FLEURS и 3,00 % на CoVoST — без учёта пунктуации и регистра, жадным декодированием без внешней языковой модели. У Canary 1B v2 — 6,90 % на FLEURS и 5,14 % на CoVoST2. На звонках и шумных записях результат будет другим — проверяйте на своих данных.
?Можно ли использовать модели в коммерческом продукте?
Да: про Parakeet v3 и Canary v2 NVIDIA пишет, что они готовы к коммерческому и некоммерческому использованию, лицензия — CC-BY-4.0, она требует указывать авторство. Nemotron 3.5 ASR распространяется под OpenMDW-1.1 с пометкой «ready for commercial use». Сам фреймворк — под Apache 2.0.
?Обязательно ли нужна видеокарта NVIDIA?
Для обучения — да. Для распознавания README называет видеокарту желательной («recommended for inference»), но PyTorch можно поставить и в варианте для процессора. В карточке Parakeet v3 поддерживаемыми названы GPU Volta, Ampere, Hopper и Blackwell, в карточке Canary v2 — Ampere, Hopper и Blackwell; ОС — Linux. Для загрузки Parakeet v3 нужно не меньше 2 ГБ памяти, для Canary v2 — не меньше 6 ГБ.
?Чем Parakeet отличается от Canary?
Parakeet v3 — компактная модель распознавания на 600 млн параметров, сама определяет язык и выдаёт текст с пунктуацией и таймкодами. Canary v2 крупнее — 978 млн параметров — и кроме распознавания переводит речь с английского на 24 языка и с этих языков на английский.
?Как установить NeMo из России?
GitHub и Hugging Face с российского IP открываются, поэтому работают установка из исходников через uv и пакет nemo-toolkit из PyPI. Каталог NGC и реестр образов nvcr.io, где лежит готовый Docker-образ nemo-speech, при нашей проверке 30.09.2026 отвечали 403 — образ можно собрать самостоятельно по Dockerfile из репозитория.
?Какой длины запись можно распознать за раз?
По карточке Parakeet v3 — до 24 минут целиком при полном внимании на видеокарте A100 80 ГБ или до 3 часов в режиме локального внимания. Для потоковых сценариев предназначена отдельная модель Nemotron 3.5 ASR Streaming.
Альтернативы NVIDIA NeMo Speech (Parakeet, Canary)
Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.
Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.
Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.
Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.
Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.
Обновлено: 30 сентября 2026 г.