Перейти к содержимому
G

GigaAM

Бесплатный тариф

Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.

github.com/salute-developers/GigaAM

Основная информация

Страна
Россия
Языки
Английский, Русский
Поддержка
Issues на GitHub
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Разработчик
SberDevices
Лицензия
MIT License
Открытый исходный код
Да — код на GitHub, веса на Hugging Face
Коммерческое использование
Разрешено: лицензия MIT даёт право использовать, изменять, распространять и продавать копии
Архитектура модели
Энкодер Conformer, декодеры CTC и RNN-T
Размеры модели
v3 — 220–240 млн параметров; multilingual — 220 и 600 млн
Объём обучающих данных
v3 — 700 000 часов предобучения, 4 000 часов разметки; multilingual — 2 млн часов на 70 с лишним языках
Языки распознавания
Линии v1–v3 — русский; multilingual — 70 с лишним языков
Точность распознавания (WER)
v3_rnnt: 2,4 % (Golos Crowd), 3,9 % (Golos Farfield), 4,4 % (Russian LibriSpeech), 0,9 % (Common Voice 19), 17,4 % (OpenSTT Phone Calls); среднее по 10 наборам — 8,3 %
Автопунктуация
Да — в вариантах v3_e2e_ctc и v3_e2e_rnnt
Тайм-коды
Таймкоды слов
Максимальная длительность файла
Функция transcribe — до 25 секунд; длиннее — transcribe_longform с pyannote.audio
Форматы экспорта
ONNX (fp32 или fp16), TensorRT для Triton Inference Server
GPU-ускорение
Для ONNX — onnxruntime-gpu и экспорт в fp16; примеры дообучения рассчитаны на разный объём видеопамяти
Распознавание эмоций
Да — модель GigaAM-Emo
Дообучение моделей
Дообучение CTC, RNN-T и энкодера через PyTorch Lightning
Требования
Python 3.10 или новее, ffmpeg
Установка
Клонировать репозиторий и выполнить pip install -e .[torch] (в PyPI — только gigaam 0.1.0 от 11.04.2025); модели также доступны через transformers
Последняя версия
GigaAM Multilingual (июнь 2026); последняя версия русской линии — v3 (ноябрь 2025)
Дата первого выпуска
Апрель 2024
Репозиторий
GitHub: salute-developers/GigaAM

Обзор GigaAM

Что такое GigaAM

GigaAM — семейство открытых моделей для обработки речи, которое выпускает SberDevices. В основе — энкодер на архитектуре Conformer размером от 220 до 600 млн параметров, предобученный на большом объёме речи. Линии v1–v3 обучены на русской речи, линия multilingual — на 70 с лишним языках. Поверх энкодера дообучены модели распознавания с декодерами CTC и RNN-T и модель распознавания эмоций GigaAM-Emo.

Код и модели распространяются под лицензией MIT; её приняли в декабре 2024 года вместе с выходом второй версии.

Версии моделей

  • v3 (ноябрь 2025) — 700 000 часов предобучения и 4 000 часов размеченных данных. Варианты ctc и rnnt, а также e2e_ctc и e2e_rnnt, которые сразу выдают текст с пунктуацией и нормализацией
  • v2 и v1 — 50 000 часов предобучения и 2 000 часов разметки
  • multilingual (июнь 2026) — энкодеры на 220 и 600 млн параметров, 2 млн часов речи на 70 с лишним языках; по словам разработчиков, по WER на русском, казахском, киргизском и узбекском она опережает модели своего класса, а на английском результат умеренный

Точность на русском

В таблице разработчиков модель v3_rnnt показывает WER 2,4 % на Golos Crowd, 3,9 % на Golos Farfield, 4,4 % на Russian LibriSpeech и 0,9 % на Mozilla Common Voice 19. На сложных данных ошибок больше: 9,5 % на записях колл-центра, 10,6 % на OpenSTT Youtube, 17,4 % на OpenSTT Phone Calls и 19,2 % на речи с нарушениями. Средний WER v3_rnnt по десяти наборам — 8,3 %, у v3_ctc — 9,1 %. В той же таблице для сравнения приведены Whisper (21,0 % после постобработки текста) и T-One с языковой моделью (16,3 %) — это измерения самих разработчиков GigaAM.

Модели e2e с пунктуацией разработчики сравнивали с Whisper-large-v3 попарно: оценку ставила языковая модель Gemini 2.5 Pro, и GigaAM выиграла в среднем со счётом 70:30.

Как запустить

Нужны Python 3.10 или новее и установленный ffmpeg. README ставит пакет из клонированного репозитория командой pip install -e .[torch], а модели загружаются по имени; в PyPI лежит только версия gigaam 0.1.0 от апреля 2025 года — она вышла раньше v3. Их можно взять и через библиотеку transformers с Hugging Face. Для продакшена модели экспортируются в ONNX: по умолчанию используется onnxruntime, для видеокарты — onnxruntime-gpu. Есть инструкция по развёртыванию в Triton Inference Server с TensorRT.

Важное ограничение: обычная функция распознавания принимает запись не длиннее 25 секунд. Для длинных файлов нужен режим longform, а он требует библиотеку pyannote.audio и токен Hugging Face с принятыми условиями доступа к модели сегментации pyannote.

Что ещё умеет

С апреля 2026 года модели выдают таймкоды слов и дообучаются на своих данных (CTC, RNN-T и самообучаемый энкодер) через PyTorch Lightning. Отдельная модель GigaAM-Emo определяет эмоцию в голосе. Энкодер можно использовать и для получения аудио-эмбеддингов.

Плюсы и минусы GigaAM

+Преимущества

  • ✓Сделана под русский язык: v3 предобучена на 700 тыс. часов речи
  • ✓Лицензия MIT прямо разрешает использовать, изменять, распространять и продавать копии
  • ✓Разработчики публикуют WER по десяти наборам, включая звонки и шумную речь
  • ✓Модели e2e сразу ставят пунктуацию — без отдельной модели
  • ✓Экспорт в ONNX упрощает встраивание в свой сервис
  • ✓Репозиторий развивается: в 2026 году добавлены дообучение, таймкоды и многоязычная линия

−Недостатки

  • ✗Обычное распознавание — только записи до 25 секунд; для длинных нужны pyannote и токен Hugging Face
  • ✗Требования к процессору, видеокарте и памяти разработчики не публикуют
  • ✗Ставится из клонированного репозитория: в PyPI только версия 0.1.0 от апреля 2025 года, релизов на GitHub нет
  • ✗На телефонных звонках и речи с нарушениями WER заметно выше: 17,4 % и 19,2 % у v3_rnnt
  • ✗Сравнение с Whisper и T-One проведено самими разработчиками GigaAM
  • ✗Нет готового HTTP-API: для продакшена — Triton Inference Server по инструкции из репозитория или своя обвязка

Сценарии использования GigaAM

1

Расшифровка записей колл-центра на своих серверах

Экспортировать модель в ONNX или TensorRT, развернуть в Triton Inference Server и распознавать звонки без передачи записей внешнему сервису.

2

Текст с пунктуацией для протоколов и субтитров

Взять вариант v3_e2e_rnnt, который сразу выдаёт текст с пунктуацией, и получать таймкоды слов для субтитров.

3

Дообучение под отраслевую лексику

Дообучить модель CTC или RNN-T на своих записях с терминами через PyTorch Lightning по примерам из репозитория.

4

Анализ эмоций в разговорах

Прогнать фрагменты звонков через GigaAM-Emo и получить вероятности эмоций для речевой аналитики.

5

Распознавание казахской, киргизской и узбекской речи

Использовать линию multilingual, для которой разработчики приводят результаты по этим языкам на Common Voice и FLEURS.

Отзывы о GigaAM

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о GigaAM

?Можно ли использовать GigaAM в коммерческом проекте?

Да. Код и модели распространяются под лицензией MIT: она разрешает использовать, изменять, распространять и продавать копии при сохранении текста лицензии. Лицензия MIT указана и в репозитории, и в карточке модели на Hugging Face.

?Какую модель выбрать для русского?

Для максимальной точности — v3_rnnt: в таблице разработчиков у неё средний WER 8,3 % по десяти наборам. Если нужен сразу читаемый текст со знаками препинания — v3_e2e_rnnt или v3_e2e_ctc. Версия v3_ctc чуть менее точна (9,1 %), зато декодер CTC проще.

?Почему GigaAM не распознаёт длинную запись целиком?

Обычная функция transcribe рассчитана на аудио до 25 секунд. Для длинных файлов есть transcribe_longform: она режет запись на фрагменты моделью сегментации pyannote. Для неё нужно поставить дополнительные зависимости и получить токен Hugging Face с доступом к pyannote/segmentation-3.0.

?Нужна ли видеокарта?

Требований к железу разработчики не публикуют. Модели экспортируются в ONNX: по умолчанию работает onnxruntime, а для видеокарты README предлагает поставить onnxruntime-gpu и экспортировать модель в fp16 — так быстрее и нужно меньше видеопамяти.

?Насколько GigaAM точнее Whisper на русском?

По таблице разработчиков средний WER Whisper на их десяти наборах — 21,0 % (после постобработки текста), у GigaAM v3_rnnt — 8,3 %. В попарном сравнении моделей с пунктуацией, где судьёй была Gemini 2.5 Pro, GigaAM выиграла со счётом 70:30. Это замеры самих авторов GigaAM — проверьте на своих данных.

?Есть ли у GigaAM готовый API?

Нет, это модели и Python-пакет. Сервис придётся собрать самостоятельно; для этого в репозитории есть экспорт в ONNX и инструкция по развёртыванию в Triton Inference Server с TensorRT.

Альтернативы GigaAM

T
T-oneFreeБесплатно

Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.

V
VoskFreeБесплатно

Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.

Whisper (OpenAI)
Whisper (OpenAI)FreeБесплатно

Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.

N
NVIDIA NeMo Speech (Parakeet, Canary)FreeБесплатно

Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.

SmartSpeech
SmartSpeech

Российский сервис речевой аналитики ООО «Речевые технологии» (Иннополис, Татарстан). Распознаёт речь, строит кластеры похожих по смыслу слов, выдаёт отчёты с фильтрами, помогает находить проблемные звонки, обучать сотрудников и улучшать репутацию бренда.

Обновлено: 30 сентября 2026 г.