GigaAM
Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.
Основная информация
Технические характеристики
- Разработчик
- SberDevices
- Лицензия
- MIT License
- Открытый исходный код
- Да — код на GitHub, веса на Hugging Face
- Коммерческое использование
- Разрешено: лицензия MIT даёт право использовать, изменять, распространять и продавать копии
- Архитектура модели
- Энкодер Conformer, декодеры CTC и RNN-T
- Размеры модели
- v3 — 220–240 млн параметров; multilingual — 220 и 600 млн
- Объём обучающих данных
- v3 — 700 000 часов предобучения, 4 000 часов разметки; multilingual — 2 млн часов на 70 с лишним языках
- Языки распознавания
- Линии v1–v3 — русский; multilingual — 70 с лишним языков
- Точность распознавания (WER)
- v3_rnnt: 2,4 % (Golos Crowd), 3,9 % (Golos Farfield), 4,4 % (Russian LibriSpeech), 0,9 % (Common Voice 19), 17,4 % (OpenSTT Phone Calls); среднее по 10 наборам — 8,3 %
- Автопунктуация
- Да — в вариантах v3_e2e_ctc и v3_e2e_rnnt
- Тайм-коды
- Таймкоды слов
- Максимальная длительность файла
- Функция transcribe — до 25 секунд; длиннее — transcribe_longform с pyannote.audio
- Форматы экспорта
- ONNX (fp32 или fp16), TensorRT для Triton Inference Server
- GPU-ускорение
- Для ONNX — onnxruntime-gpu и экспорт в fp16; примеры дообучения рассчитаны на разный объём видеопамяти
- Распознавание эмоций
- Да — модель GigaAM-Emo
- Дообучение моделей
- Дообучение CTC, RNN-T и энкодера через PyTorch Lightning
- Требования
- Python 3.10 или новее, ffmpeg
- Установка
- Клонировать репозиторий и выполнить pip install -e .[torch] (в PyPI — только gigaam 0.1.0 от 11.04.2025); модели также доступны через transformers
- Последняя версия
- GigaAM Multilingual (июнь 2026); последняя версия русской линии — v3 (ноябрь 2025)
- Дата первого выпуска
- Апрель 2024
- Репозиторий
- GitHub: salute-developers/GigaAM
Обзор GigaAM
Что такое GigaAM
GigaAM — семейство открытых моделей для обработки речи, которое выпускает SberDevices. В основе — энкодер на архитектуре Conformer размером от 220 до 600 млн параметров, предобученный на большом объёме речи. Линии v1–v3 обучены на русской речи, линия multilingual — на 70 с лишним языках. Поверх энкодера дообучены модели распознавания с декодерами CTC и RNN-T и модель распознавания эмоций GigaAM-Emo.
Код и модели распространяются под лицензией MIT; её приняли в декабре 2024 года вместе с выходом второй версии.
Версии моделей
- v3 (ноябрь 2025) — 700 000 часов предобучения и 4 000 часов размеченных данных. Варианты ctc и rnnt, а также e2e_ctc и e2e_rnnt, которые сразу выдают текст с пунктуацией и нормализацией
- v2 и v1 — 50 000 часов предобучения и 2 000 часов разметки
- multilingual (июнь 2026) — энкодеры на 220 и 600 млн параметров, 2 млн часов речи на 70 с лишним языках; по словам разработчиков, по WER на русском, казахском, киргизском и узбекском она опережает модели своего класса, а на английском результат умеренный
Точность на русском
В таблице разработчиков модель v3_rnnt показывает WER 2,4 % на Golos Crowd, 3,9 % на Golos Farfield, 4,4 % на Russian LibriSpeech и 0,9 % на Mozilla Common Voice 19. На сложных данных ошибок больше: 9,5 % на записях колл-центра, 10,6 % на OpenSTT Youtube, 17,4 % на OpenSTT Phone Calls и 19,2 % на речи с нарушениями. Средний WER v3_rnnt по десяти наборам — 8,3 %, у v3_ctc — 9,1 %. В той же таблице для сравнения приведены Whisper (21,0 % после постобработки текста) и T-One с языковой моделью (16,3 %) — это измерения самих разработчиков GigaAM.
Модели e2e с пунктуацией разработчики сравнивали с Whisper-large-v3 попарно: оценку ставила языковая модель Gemini 2.5 Pro, и GigaAM выиграла в среднем со счётом 70:30.
Как запустить
Нужны Python 3.10 или новее и установленный ffmpeg. README ставит пакет из клонированного репозитория командой pip install -e .[torch], а модели загружаются по имени; в PyPI лежит только версия gigaam 0.1.0 от апреля 2025 года — она вышла раньше v3. Их можно взять и через библиотеку transformers с Hugging Face. Для продакшена модели экспортируются в ONNX: по умолчанию используется onnxruntime, для видеокарты — onnxruntime-gpu. Есть инструкция по развёртыванию в Triton Inference Server с TensorRT.
Важное ограничение: обычная функция распознавания принимает запись не длиннее 25 секунд. Для длинных файлов нужен режим longform, а он требует библиотеку pyannote.audio и токен Hugging Face с принятыми условиями доступа к модели сегментации pyannote.
Что ещё умеет
С апреля 2026 года модели выдают таймкоды слов и дообучаются на своих данных (CTC, RNN-T и самообучаемый энкодер) через PyTorch Lightning. Отдельная модель GigaAM-Emo определяет эмоцию в голосе. Энкодер можно использовать и для получения аудио-эмбеддингов.
Плюсы и минусы GigaAM
+Преимущества
- ✓Сделана под русский язык: v3 предобучена на 700 тыс. часов речи
- ✓Лицензия MIT прямо разрешает использовать, изменять, распространять и продавать копии
- ✓Разработчики публикуют WER по десяти наборам, включая звонки и шумную речь
- ✓Модели e2e сразу ставят пунктуацию — без отдельной модели
- ✓Экспорт в ONNX упрощает встраивание в свой сервис
- ✓Репозиторий развивается: в 2026 году добавлены дообучение, таймкоды и многоязычная линия
−Недостатки
- ✗Обычное распознавание — только записи до 25 секунд; для длинных нужны pyannote и токен Hugging Face
- ✗Требования к процессору, видеокарте и памяти разработчики не публикуют
- ✗Ставится из клонированного репозитория: в PyPI только версия 0.1.0 от апреля 2025 года, релизов на GitHub нет
- ✗На телефонных звонках и речи с нарушениями WER заметно выше: 17,4 % и 19,2 % у v3_rnnt
- ✗Сравнение с Whisper и T-One проведено самими разработчиками GigaAM
- ✗Нет готового HTTP-API: для продакшена — Triton Inference Server по инструкции из репозитория или своя обвязка
Сценарии использования GigaAM
Расшифровка записей колл-центра на своих серверах
Экспортировать модель в ONNX или TensorRT, развернуть в Triton Inference Server и распознавать звонки без передачи записей внешнему сервису.
Текст с пунктуацией для протоколов и субтитров
Взять вариант v3_e2e_rnnt, который сразу выдаёт текст с пунктуацией, и получать таймкоды слов для субтитров.
Дообучение под отраслевую лексику
Дообучить модель CTC или RNN-T на своих записях с терминами через PyTorch Lightning по примерам из репозитория.
Анализ эмоций в разговорах
Прогнать фрагменты звонков через GigaAM-Emo и получить вероятности эмоций для речевой аналитики.
Распознавание казахской, киргизской и узбекской речи
Использовать линию multilingual, для которой разработчики приводят результаты по этим языкам на Common Voice и FLEURS.
Отзывы о GigaAM
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о GigaAM
?Можно ли использовать GigaAM в коммерческом проекте?
Да. Код и модели распространяются под лицензией MIT: она разрешает использовать, изменять, распространять и продавать копии при сохранении текста лицензии. Лицензия MIT указана и в репозитории, и в карточке модели на Hugging Face.
?Какую модель выбрать для русского?
Для максимальной точности — v3_rnnt: в таблице разработчиков у неё средний WER 8,3 % по десяти наборам. Если нужен сразу читаемый текст со знаками препинания — v3_e2e_rnnt или v3_e2e_ctc. Версия v3_ctc чуть менее точна (9,1 %), зато декодер CTC проще.
?Почему GigaAM не распознаёт длинную запись целиком?
Обычная функция transcribe рассчитана на аудио до 25 секунд. Для длинных файлов есть transcribe_longform: она режет запись на фрагменты моделью сегментации pyannote. Для неё нужно поставить дополнительные зависимости и получить токен Hugging Face с доступом к pyannote/segmentation-3.0.
?Нужна ли видеокарта?
Требований к железу разработчики не публикуют. Модели экспортируются в ONNX: по умолчанию работает onnxruntime, а для видеокарты README предлагает поставить onnxruntime-gpu и экспортировать модель в fp16 — так быстрее и нужно меньше видеопамяти.
?Насколько GigaAM точнее Whisper на русском?
По таблице разработчиков средний WER Whisper на их десяти наборах — 21,0 % (после постобработки текста), у GigaAM v3_rnnt — 8,3 %. В попарном сравнении моделей с пунктуацией, где судьёй была Gemini 2.5 Pro, GigaAM выиграла со счётом 70:30. Это замеры самих авторов GigaAM — проверьте на своих данных.
?Есть ли у GigaAM готовый API?
Нет, это модели и Python-пакет. Сервис придётся собрать самостоятельно; для этого в репозитории есть экспорт в ONNX и инструкция по развёртыванию в Triton Inference Server с TensorRT.
Альтернативы GigaAM
Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.
Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.
Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.
Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.
Российский сервис речевой аналитики ООО «Речевые технологии» (Иннополис, Татарстан). Распознаёт речь, строит кластеры похожих по смыслу слов, выдаёт отчёты с фильтрами, помогает находить проблемные звонки, обучать сотрудников и улучшать репутацию бренда.
Обновлено: 30 сентября 2026 г.