Перейти к содержимому
V

Vosk

Бесплатный тариф

Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.

alphacephei.com/vosk

Основная информация

Страна
Международный
Языки
Английский, Русский и ещё 1
Поддержка
Email contact@alphacephei.com, Issues на GitHub и ещё 2
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Разработчик
Alpha Cephei Inc.
Лицензия
Apache License 2.0 (код); лицензия каждой модели указана в таблице моделей
Открытый исходный код
Да — код библиотеки и сервера на GitHub, модели скачиваются с сайта
Коммерческое использование
Apache 2.0 даёт безвозмездную бессрочную лицензию воспроизводить, изменять, сублицензировать и распространять код, а её патентная часть прямо называет продажу («sell»); отдельной оговорки о коммерции в README нет
Языки распознавания
Больше 20 языков и диалектов, в том числе русский, украинский, казахский, узбекский, таджикский, киргизский, грузинский
Размеры модели
Русские: 45 МБ (small-ru-0.22), 1,5 ГБ (ru-0.22), 1,8 ГБ (ru-0.42), 2,5 ГБ (ru-0.10)
Точность распознавания (WER)
vosk-model-ru-0.42: 4,4 (golos crowd), 11,1 (open_stt audiobooks), 19,5 (open_stt youtube), 36,0 (openstt calls); small-ru-0.22: 11,79 (golos crowd), 22,71 (openstt audiobooks) — по таблице вендора
Требования к железу
Маленькая модель — около 300 МБ памяти; большие — до 16 ГБ памяти, процессор уровня i7 или AMD Ryzen
GPU-ускорение
Готовых CUDA-сборок нет; GPU-декодер собирается из исходников
Платформы
Linux x86_64 и arm64, Raspbian (Raspberry Pi 3/4), macOS Intel и M1, Windows x86 и x64, Android, iOS по запросу
Языки SDK
Python, Java, Node.JS, C#, C++, Rust, Go
Команда установки
pip3 install vosk
Docker-образ
alphacep/kaldi-ru и образы других языков на Docker Hub
Протоколы API
WebSocket, gRPC, MQTT, WebRTC (vosk-server)
Офлайн-режим
Да — распознавание без подключения к интернету
Streaming-режим
Да — потоковый API с ответом по мере речи
Пользовательский словарь терминов
Перенастройка словаря на лету у большинства маленьких моделей; у больших словарь статичен
Идентификация спикеров
Отдельная модель vosk-model-spk-0.4 (13 МБ)
Автопунктуация
Отдельной моделью vosk-recasepunc-ru-0.22 (1,6 ГБ)
Телефония
Подключение vosk-server к Asterisk и FreeSWITCH
Последняя версия
v0.3.50 на GitHub (22.04.2024); 0.3.45 в PyPI (14.12.2022)
Требования
Страница установки называет Python 3.5–3.9 и pip 20.3 или новее
Репозиторий
GitHub: alphacep/vosk-api и alphacep/vosk-server

Обзор Vosk

Что такое Vosk

Vosk — открытый набор инструментов для распознавания речи от компании Alpha Cephei. Вендор описывает его как офлайн-движок: звук никуда не отправляется, модель лежит рядом с приложением. На сайте перечислено больше двадцати языков и диалектов, среди них русский, украинский, казахский, узбекский, таджикский, киргизский и грузинский. Серверная часть, по словам README, построена на Kaldi и Vosk-API.

Библиотека даёт потоковый API с мгновенным ответом по мере речи, позволяет на лету перенастраивать словарь и умеет идентифицировать говорящего отдельной моделью. Привязки есть для Python, Java, Node.JS, C#, C++, Rust, Go и других языков.

Модели для русского языка

  • vosk-model-small-ru-0.22 — 45 МБ, для Android, iOS и Raspberry Pi. WER по таблице вендора: 22,71 (openstt audiobooks), 31,97 (openstt youtube), 29,89 (sova devices), 11,79 (golos crowd)
  • vosk-model-ru-0.42 — 1,8 ГБ, серверная смешанной полосы. WER: 4,5 (собственный набор аудиокниг вендора), 11,1 (open_stt audiobooks), 19,5 (open_stt youtube), 36,0 (openstt calls), 4,4 (golos crowd), 17,9 (sova devices)
  • vosk-model-ru-0.22 — 1,5 ГБ, ещё одна серверная модель смешанной полосы (раздел «Russian Other» таблицы вендора)
  • vosk-model-ru-0.10 — 2,5 ГБ, серверная узкополосная
  • vosk-recasepunc-ru-0.22 — 1,6 ГБ, отдельная модель для расстановки знаков препинания и заглавных букв

Все русские модели в таблице — под Apache 2.0. Цифры WER вендор приводит по наборам данных; на звонках (openstt calls) ошибок заметно больше, чем на аудиокнигах, — это стоит учитывать при выборе модели для колл-центра.

На каком железе работает

Маленькая модель, по словам вендора, весит около 50 МБ и занимает около 300 МБ памяти при работе — вендор предлагает её для мобильных и настольных приложений. Большим серверным моделям нужно до 16 ГБ памяти, и запускать их советуют на мощных процессорах уровня i7 или AMD Ryzen. Готовых сборок под CUDA вендор не выпускает: GPU-декодер придётся собирать самостоятельно по Docker-файлам из репозитория.

Python-пакет ставится командой pip3 install vosk на Linux x86_64 и arm64, Raspbian на Raspberry Pi 3/4, macOS (Intel и M1) и Windows. Не поддерживаются ARMv6 (Raspberry Pi Zero вендор называет слишком медленным) и Windows ARM64. Для Android есть библиотека в mavenCentral, сборка под iOS выдаётся по запросу.

Сервер для телефонии и веба

Отдельный проект vosk-server поднимает распознавание как сервис по протоколам WebSocket, gRPC, MQTT и WebRTC. Его можно подключить к АТС Asterisk или FreeSWITCH, к чат-боту или сайту. Запускается одной командой Docker; на Docker Hub есть готовые образы с моделями, в том числе kaldi-ru для русского.

Лицензия и коммерческие версии

Код Vosk распространяется под Apache License 2.0. Лицензия задаётся для каждой модели отдельно: русские — Apache 2.0, но в общей таблице встречаются модели других языков под AGPL, LGPL-3.0 и CC-BY-NC-SA 4.0 — перед встраиванием в продукт лицензию конкретной модели нужно проверить. Кроме открытой версии Alpha Cephei предлагает Vosk Enterprise (больше языков, повышенная точность, поддержка, обучение) и Vosk Mobile (iOS и Unity) — цены не опубликованы, условия по запросу.

Насколько живой проект

Последний релиз на GitHub — v0.3.50 от 22 апреля 2024 года, а в PyPI лежит 0.3.45 от декабря 2022 года. Страница установки по-прежнему называет Python 3.5–3.9. Модели при этом продолжают выходить: в мае 2026 года вендор выпустил грузинскую.

Плюсы и минусы Vosk

+Преимущества

  • ✓Работает офлайн: звук не уходит на чужой сервер
  • ✓Маленькая русская модель весит 45 МБ, а маленьким моделям, по словам вендора, нужно около 300 МБ памяти — они рассчитаны на Raspberry Pi и смартфоны
  • ✓Не нужен GPU: вендор ориентирует даже большие модели на процессор
  • ✓Код и русские модели под Apache 2.0
  • ✓Готовый Docker-сервер для телефонии и веба
  • ✓Вендор публикует WER каждой модели по открытым наборам данных
  • ✓Сайт, репозиторий и архивы моделей открываются с российского IP (проверка 30.09.2026)

−Недостатки

  • ✗Маленькая русская модель ошибается заметно чаще серверной: WER 22,71 против 11,1 на open_stt audiobooks
  • ✗На телефонных звонках даже большая модель даёт WER 36,0 (openstt calls) по таблице вендора
  • ✗Знаки препинания и заглавные буквы вендор предлагает восстанавливать отдельной моделью recasepunc на 1,6 ГБ
  • ✗Последний релиз библиотеки — апрель 2024 года, в PyPI версия декабря 2022-го
  • ✗Готовых сборок под CUDA нет, GPU-декодер собирается вручную
  • ✗Сборка под iOS выдаётся только по запросу
  • ✗У части моделей других языков лицензии AGPL и CC-BY-NC-SA — проверять каждую

Сценарии использования Vosk

1

Голосовое управление без интернета

Поставить маленькую русскую модель на Raspberry Pi или Android-устройство и распознавать команды умного дома локально, без передачи звука в облако.

2

Распознавание звонков на своей АТС

Поднять vosk-server из Docker-образа kaldi-ru и подключить его к Asterisk или FreeSWITCH, чтобы получать текст разговоров внутри своей инфраструктуры.

3

Субтитры и расшифровка лекций

Прогнать записи через серверную модель vosk-model-ru-0.42 на обычном сервере без видеокарты, а знаки препинания расставить моделью recasepunc.

4

Голосовой ввод в настольном приложении

Встроить библиотеку через привязку для Python, Java или C# и перенастраивать словарь под предметную область прямо во время работы.

5

Прототип голосового бота

Подключить потоковый API к чат-боту через WebSocket-сервер и получать распознанный текст по мере речи собеседника.

Отзывы о Vosk

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о Vosk

?Какую модель Vosk взять для русского языка?

Для телефона, Raspberry Pi и настольных программ вендор предлагает vosk-model-small-ru-0.22 на 45 МБ. Для расшифровки на сервере — vosk-model-ru-0.42 на 1,8 ГБ: по таблице вендора у неё WER 11,1 на open_stt audiobooks против 22,71 у маленькой. Есть ещё узкополосная серверная vosk-model-ru-0.10 на 2,5 ГБ.

?Нужна ли видеокарта?

Нет. Вендор рассчитывает даже большие модели на процессор: им нужно до 16 ГБ памяти и CPU уровня i7 или AMD Ryzen. Готовых сборок под CUDA Alpha Cephei не выпускает — GPU-декодер можно собрать самостоятельно по Docker-файлам из репозитория vosk-server.

?Ставит ли Vosk знаки препинания?

Для расстановки знаков препинания и заглавных букв вендор предлагает отдельные модели, обученные инструментом recasepunc. Для русского это vosk-recasepunc-ru-0.22 на 1,6 ГБ под Apache 2.0 — её подключают в дополнение к модели распознавания.

?Можно ли использовать Vosk в коммерческом продукте?

Код распространяется под Apache License 2.0, русские модели в таблице вендора — тоже под Apache 2.0. Эта лицензия даёт безвозмездное право воспроизводить, изменять, сублицензировать и распространять код при сохранении текста лицензии и уведомлений, а её патентная часть прямо упоминает продажу. Но у части моделей других языков лицензии AGPL, LGPL-3.0 или CC-BY-NC-SA 4.0 — лицензию берите из таблицы для каждой модели отдельно.

?Как подключить Vosk к телефонии?

Через vosk-server: он работает по WebSocket, gRPC, MQTT и WebRTC и запускается одной командой Docker. На Docker Hub есть готовый образ kaldi-ru с русской моделью. README сервера прямо называет АТС Asterisk и FreeSWITCH среди мест применения.

?Обновляется ли проект?

Релизы библиотеки выходят редко: последний на GitHub — v0.3.50 от 22 апреля 2024 года, в PyPI лежит 0.3.45 от декабря 2022-го, а страница установки называет Python 3.5–3.9. Модели выходят и сейчас — грузинскую вендор выпустил в мае 2026 года.

?Чем Vosk Enterprise отличается от открытой версии?

По описанию на сайте Alpha Cephei, Enterprise даёт больше языков, повышенную точность, постоянную поддержку и обучение технологии, а Vosk Mobile — работу на iOS и в Unity. Цен на сайте нет, условия обсуждаются по запросу через форму или e-mail.

Альтернативы Vosk

G
GigaAMFreeБесплатно

Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.

T
T-oneFreeБесплатно

Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.

Whisper (OpenAI)
Whisper (OpenAI)FreeБесплатно

Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.

N
NVIDIA NeMo Speech (Parakeet, Canary)FreeБесплатно

Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.

Q
Qwen3-ASRFreeБесплатно

Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.

Обновлено: 30 сентября 2026 г.