Перейти к содержимому
N

NVIDIA NeMo Speech (Parakeet, Canary)

Бесплатный тариф

Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.

github.com/NVIDIA-NeMo/Speech

Основная информация

Страна
Международный
Языки
Английский
Поддержка
Issues на GitHub, Документация docs.nvidia.com
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Разработчик
NVIDIA
Лицензия
Фреймворк — Apache License 2.0; веса Parakeet v3 и Canary v2 — CC-BY-4.0; Nemotron 3.5 ASR — OpenMDW-1.1
Открытый исходный код
Да — код фреймворка на GitHub, веса моделей на Hugging Face
Коммерческое использование
Parakeet v3 и Canary v2: «ready for commercial/non-commercial use»; Nemotron 3.5 ASR: «ready for commercial use»
AI-модели
Parakeet TDT 0.6B v3, Canary 1B v2, Nemotron 3.5 ASR Streaming 0.6B
Размеры модели
Parakeet v3 — 600 млн параметров; Canary v2 — 978 млн; Nemotron 3.5 ASR — 600 млн
Языки распознавания
Parakeet v3 и Canary v2 — 25 европейских языков, в том числе русский и украинский; Nemotron 3.5 ASR — 40 языковых локалей, в том числе ru-RU
Точность распознавания (WER)
Русский: Parakeet v3 — 5,51 % (FLEURS), 3,00 % (CoVoST); Canary v2 — 6,90 % (FLEURS test), 5,14 % (CoVoST2 test); без учёта пунктуации и регистра
Определение языка
Да — Parakeet v3 определяет язык записи сама
Автопунктуация
Да — пунктуация и заглавные буквы в выводе моделей
Тайм-коды
Слов и сегментов; у перевода Canary v2 — сегментов
Перевод речи (Speech Translation)
Canary v2 — с английского на 24 языка и с 24 языков на английский
Streaming-режим
Nemotron 3.5 ASR Streaming — задержка настраивается от 80 мс до 1 с
Максимальная длительность файла
Parakeet v3: до 24 минут целиком на A100 80 ГБ или до 3 часов с локальным вниманием
Требования к железу
GPU NVIDIA рекомендован для распознавания и обязателен для обучения; Parakeet v3 — Volta, Ampere, Hopper, Blackwell и не меньше 2 ГБ памяти; Canary v2 — Ampere, Hopper, Blackwell и не меньше 6 ГБ
Платформы
Linux
Требования
Python 3.12 или новее, PyTorch 2.7 или новее
Команда установки
pip install 'nemo-toolkit[asr,tts]'
Docker-образ
nvcr.io/nvidia/nemo-speech:26.07.00 (каталог NGC)
Дообучение моделей
Да — дообучение моделей распознавания на своих данных
Разделение по спикерам
Да — модули диаризации в составе фреймворка
Последняя версия
v3.0.0 (NVIDIA NeMo Speech 3.0) от 07.08.2026
Дата релиза
Parakeet v3 и Canary v2 — 14.08.2025; Nemotron 3.5 ASR Streaming — июнь 2026
Репозиторий
GitHub: NVIDIA-NeMo/Speech (прежнее имя NVIDIA/NeMo)

Обзор NVIDIA NeMo Speech (Parakeet, Canary)

Что такое NeMo Speech

NeMo Speech — открытый фреймворк NVIDIA для исследователей и разработчиков на PyTorch, которые работают с распознаванием речи, синтезом и речевыми языковыми моделями. В 2026 году репозиторий NVIDIA/NeMo переименовали в NVIDIA-NeMo/Speech и сосредоточили на речи, а языковые, визуальные и прочие модули вынесли в отдельные репозитории. Версия 3.0 от 7 августа 2026 года — первый крупный релиз после разделения. Сам фреймворк распространяется под Apache License 2.0, готовые модели лежат на Hugging Face со своими лицензиями.

Модели с поддержкой русского языка

  • Parakeet TDT 0.6B v3 — 600 млн параметров, 25 европейских языков, в том числе русский и украинский. Сама определяет язык записи, ставит знаки препинания и заглавные буквы, выдаёт таймкоды слов и сегментов. Лицензия CC-BY-4.0, выпущена 14 августа 2025 года
  • Canary 1B v2 — 978 млн параметров, те же 25 языков: распознаёт речь и переводит её с английского на 24 языка и с 24 языков на английский, таймкоды сегментов есть и у перевода. Лицензия CC-BY-4.0, выпущена 14 августа 2025 года
  • Nemotron 3.5 ASR Streaming 0.6B — потоковая модель на 40 языковых локалей с настраиваемой задержкой от 80 мс до 1 с; русский входит в группу «готовых к транскрибации». Лицензия OpenMDW-1.1, выпущена в июне 2026 года

Обе модели выпуска 2025 года NVIDIA помечает как готовые к коммерческому и некоммерческому использованию; про потоковую сказано «ready for commercial use».

Точность на русском

В карточках моделей WER считается без учёта пунктуации и регистра. Parakeet v3 на русском: 5,51 % на FLEURS и 3,00 % на CoVoST (жадное декодирование без внешней языковой модели). Canary 1B v2: 6,90 % на тестовой части FLEURS и 5,14 % на CoVoST2. Это публичные наборы чтения и озвучки; на звонках и шумной записи цифры будут другими — для телефонии модель стоит проверить на своих данных.

Что нужно для запуска

Фреймворку нужны Python 3.12 или новее и PyTorch 2.7 или новее. Видеокарта NVIDIA с CUDA обязательна для обучения и рекомендована для распознавания. В карточке Parakeet v3 указаны архитектуры GPU Volta, Ampere, Hopper и Blackwell, в карточке Canary v2 — Ampere, Hopper и Blackwell; ОС в обеих — Linux. Для загрузки Parakeet v3 нужно не меньше 2 ГБ памяти, для Canary v2 — не меньше 6 ГБ. Parakeet v3 обрабатывает до 24 минут записи целиком на A100 80 ГБ или до 3 часов в режиме локального внимания.

Установить можно из исходников через uv, пакетом nemo-toolkit из PyPI поверх своей сборки PyTorch или готовым Docker-образом nemo-speech из каталога NGC. Каталог NGC и реестр образов nvcr.io с российского IP отвечают 403, GitHub и Hugging Face открываются; образ можно собрать самостоятельно по Dockerfile из репозитория.

Что ещё есть во фреймворке

Кроме распознавания — синтез речи, диаризация и детектор голосовой активности, дообучение моделей на своих данных, подсказка фраз для точного распознавания терминов. В версии 3.0 NVIDIA удалила 800 тысяч строк устаревшего кода и неподдерживаемые модели, а установку перевела на менеджер пакетов uv.

Плюсы и минусы NVIDIA NeMo Speech (Parakeet, Canary)

+Преимущества

  • ✓Русский язык поддерживается в готовых моделях — без дообучения
  • ✓Модели выпуска 2025 года прямо разрешены для коммерческого использования (CC-BY-4.0)
  • ✓WER для русского опубликован по открытым наборам FLEURS и CoVoST
  • ✓Пунктуация и таймкоды — без отдельной модели
  • ✓Фреймворк активно развивается: релиз 3.0 вышел в августе 2026 года
  • ✓Одна кодовая база для распознавания, перевода, синтеза и диаризации

−Недостатки

  • ✗Рассчитан на видеокарты NVIDIA и Linux: GPU с CUDA обязателен для обучения и рекомендован для распознавания
  • ✗Каталог NGC и реестр nvcr.io с готовым Docker-образом с российского IP отвечают 403 — остаются pip и сборка из исходников
  • ✗Нужен свежий стек: Python 3.12 и PyTorch 2.7 или новее
  • ✗Порог входа выше, чем у готовых API: нужен опыт PyTorch и DevOps
  • ✗CC-BY-4.0 требует указывать авторство NVIDIA при использовании моделей
  • ✗Цифры WER получены на публичных наборах чтения, для звонков модель нужно проверять на своих данных

Сценарии использования NVIDIA NeMo Speech (Parakeet, Canary)

1

Расшифровка записей на своём GPU-сервере

Запустить Parakeet v3 на сервере с видеокартой NVIDIA и получать русский текст сразу с пунктуацией и таймкодами слов, не отправляя записи во внешнее облако.

2

Субтитры с переводом

Распознать русскую речь моделью Canary v2 и сразу получить английский перевод с таймкодами сегментов для субтитров.

3

Голосовой агент реального времени

Поставить потоковую Nemotron 3.5 ASR и подобрать задержку от 80 мс до 1 с под сценарий голосового бота.

4

Дообучение под свою предметную область

Взять готовые веса и дообучить модель на записях своего колл-центра или отраслевой лексике средствами фреймворка.

5

Исследования и эксперименты с речевыми моделями

Использовать фреймворк для обучения собственных моделей распознавания, синтеза и речевых языковых моделей на PyTorch.

Отзывы о NVIDIA NeMo Speech (Parakeet, Canary)

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о NVIDIA NeMo Speech (Parakeet, Canary)

?Какие модели NeMo понимают русский язык?

Parakeet TDT 0.6B v3 и Canary 1B v2 — обе поддерживают 25 европейских языков, в том числе русский и украинский. Потоковая Nemotron 3.5 ASR Streaming 0.6B поддерживает 40 языковых локалей, и русский входит в группу «готовых к транскрибации» без дообучения.

?Насколько точно Parakeet распознаёт русскую речь?

По карточке модели у Parakeet v3 на русском WER 5,51 % на наборе FLEURS и 3,00 % на CoVoST — без учёта пунктуации и регистра, жадным декодированием без внешней языковой модели. У Canary 1B v2 — 6,90 % на FLEURS и 5,14 % на CoVoST2. На звонках и шумных записях результат будет другим — проверяйте на своих данных.

?Можно ли использовать модели в коммерческом продукте?

Да: про Parakeet v3 и Canary v2 NVIDIA пишет, что они готовы к коммерческому и некоммерческому использованию, лицензия — CC-BY-4.0, она требует указывать авторство. Nemotron 3.5 ASR распространяется под OpenMDW-1.1 с пометкой «ready for commercial use». Сам фреймворк — под Apache 2.0.

?Обязательно ли нужна видеокарта NVIDIA?

Для обучения — да. Для распознавания README называет видеокарту желательной («recommended for inference»), но PyTorch можно поставить и в варианте для процессора. В карточке Parakeet v3 поддерживаемыми названы GPU Volta, Ampere, Hopper и Blackwell, в карточке Canary v2 — Ampere, Hopper и Blackwell; ОС — Linux. Для загрузки Parakeet v3 нужно не меньше 2 ГБ памяти, для Canary v2 — не меньше 6 ГБ.

?Чем Parakeet отличается от Canary?

Parakeet v3 — компактная модель распознавания на 600 млн параметров, сама определяет язык и выдаёт текст с пунктуацией и таймкодами. Canary v2 крупнее — 978 млн параметров — и кроме распознавания переводит речь с английского на 24 языка и с этих языков на английский.

?Как установить NeMo из России?

GitHub и Hugging Face с российского IP открываются, поэтому работают установка из исходников через uv и пакет nemo-toolkit из PyPI. Каталог NGC и реестр образов nvcr.io, где лежит готовый Docker-образ nemo-speech, при нашей проверке 30.09.2026 отвечали 403 — образ можно собрать самостоятельно по Dockerfile из репозитория.

?Какой длины запись можно распознать за раз?

По карточке Parakeet v3 — до 24 минут целиком при полном внимании на видеокарте A100 80 ГБ или до 3 часов в режиме локального внимания. Для потоковых сценариев предназначена отдельная модель Nemotron 3.5 ASR Streaming.

Альтернативы NVIDIA NeMo Speech (Parakeet, Canary)

Whisper (OpenAI)
Whisper (OpenAI)FreeБесплатно

Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.

Q
Qwen3-ASRFreeБесплатно

Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.

G
GigaAMFreeБесплатно

Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.

V
VoskFreeБесплатно

Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.

T
T-oneFreeБесплатно

Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.

Обновлено: 30 сентября 2026 г.