Vosk
Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.
Основная информация
Технические характеристики
- Разработчик
- Alpha Cephei Inc.
- Лицензия
- Apache License 2.0 (код); лицензия каждой модели указана в таблице моделей
- Открытый исходный код
- Да — код библиотеки и сервера на GitHub, модели скачиваются с сайта
- Коммерческое использование
- Apache 2.0 даёт безвозмездную бессрочную лицензию воспроизводить, изменять, сублицензировать и распространять код, а её патентная часть прямо называет продажу («sell»); отдельной оговорки о коммерции в README нет
- Языки распознавания
- Больше 20 языков и диалектов, в том числе русский, украинский, казахский, узбекский, таджикский, киргизский, грузинский
- Размеры модели
- Русские: 45 МБ (small-ru-0.22), 1,5 ГБ (ru-0.22), 1,8 ГБ (ru-0.42), 2,5 ГБ (ru-0.10)
- Точность распознавания (WER)
- vosk-model-ru-0.42: 4,4 (golos crowd), 11,1 (open_stt audiobooks), 19,5 (open_stt youtube), 36,0 (openstt calls); small-ru-0.22: 11,79 (golos crowd), 22,71 (openstt audiobooks) — по таблице вендора
- Требования к железу
- Маленькая модель — около 300 МБ памяти; большие — до 16 ГБ памяти, процессор уровня i7 или AMD Ryzen
- GPU-ускорение
- Готовых CUDA-сборок нет; GPU-декодер собирается из исходников
- Платформы
- Linux x86_64 и arm64, Raspbian (Raspberry Pi 3/4), macOS Intel и M1, Windows x86 и x64, Android, iOS по запросу
- Языки SDK
- Python, Java, Node.JS, C#, C++, Rust, Go
- Команда установки
- pip3 install vosk
- Docker-образ
- alphacep/kaldi-ru и образы других языков на Docker Hub
- Протоколы API
- WebSocket, gRPC, MQTT, WebRTC (vosk-server)
- Офлайн-режим
- Да — распознавание без подключения к интернету
- Streaming-режим
- Да — потоковый API с ответом по мере речи
- Пользовательский словарь терминов
- Перенастройка словаря на лету у большинства маленьких моделей; у больших словарь статичен
- Идентификация спикеров
- Отдельная модель vosk-model-spk-0.4 (13 МБ)
- Автопунктуация
- Отдельной моделью vosk-recasepunc-ru-0.22 (1,6 ГБ)
- Телефония
- Подключение vosk-server к Asterisk и FreeSWITCH
- Последняя версия
- v0.3.50 на GitHub (22.04.2024); 0.3.45 в PyPI (14.12.2022)
- Требования
- Страница установки называет Python 3.5–3.9 и pip 20.3 или новее
- Репозиторий
- GitHub: alphacep/vosk-api и alphacep/vosk-server
Обзор Vosk
Что такое Vosk
Vosk — открытый набор инструментов для распознавания речи от компании Alpha Cephei. Вендор описывает его как офлайн-движок: звук никуда не отправляется, модель лежит рядом с приложением. На сайте перечислено больше двадцати языков и диалектов, среди них русский, украинский, казахский, узбекский, таджикский, киргизский и грузинский. Серверная часть, по словам README, построена на Kaldi и Vosk-API.
Библиотека даёт потоковый API с мгновенным ответом по мере речи, позволяет на лету перенастраивать словарь и умеет идентифицировать говорящего отдельной моделью. Привязки есть для Python, Java, Node.JS, C#, C++, Rust, Go и других языков.
Модели для русского языка
- vosk-model-small-ru-0.22 — 45 МБ, для Android, iOS и Raspberry Pi. WER по таблице вендора: 22,71 (openstt audiobooks), 31,97 (openstt youtube), 29,89 (sova devices), 11,79 (golos crowd)
- vosk-model-ru-0.42 — 1,8 ГБ, серверная смешанной полосы. WER: 4,5 (собственный набор аудиокниг вендора), 11,1 (open_stt audiobooks), 19,5 (open_stt youtube), 36,0 (openstt calls), 4,4 (golos crowd), 17,9 (sova devices)
- vosk-model-ru-0.22 — 1,5 ГБ, ещё одна серверная модель смешанной полосы (раздел «Russian Other» таблицы вендора)
- vosk-model-ru-0.10 — 2,5 ГБ, серверная узкополосная
- vosk-recasepunc-ru-0.22 — 1,6 ГБ, отдельная модель для расстановки знаков препинания и заглавных букв
Все русские модели в таблице — под Apache 2.0. Цифры WER вендор приводит по наборам данных; на звонках (openstt calls) ошибок заметно больше, чем на аудиокнигах, — это стоит учитывать при выборе модели для колл-центра.
На каком железе работает
Маленькая модель, по словам вендора, весит около 50 МБ и занимает около 300 МБ памяти при работе — вендор предлагает её для мобильных и настольных приложений. Большим серверным моделям нужно до 16 ГБ памяти, и запускать их советуют на мощных процессорах уровня i7 или AMD Ryzen. Готовых сборок под CUDA вендор не выпускает: GPU-декодер придётся собирать самостоятельно по Docker-файлам из репозитория.
Python-пакет ставится командой pip3 install vosk на Linux x86_64 и arm64, Raspbian на Raspberry Pi 3/4, macOS (Intel и M1) и Windows. Не поддерживаются ARMv6 (Raspberry Pi Zero вендор называет слишком медленным) и Windows ARM64. Для Android есть библиотека в mavenCentral, сборка под iOS выдаётся по запросу.
Сервер для телефонии и веба
Отдельный проект vosk-server поднимает распознавание как сервис по протоколам WebSocket, gRPC, MQTT и WebRTC. Его можно подключить к АТС Asterisk или FreeSWITCH, к чат-боту или сайту. Запускается одной командой Docker; на Docker Hub есть готовые образы с моделями, в том числе kaldi-ru для русского.
Лицензия и коммерческие версии
Код Vosk распространяется под Apache License 2.0. Лицензия задаётся для каждой модели отдельно: русские — Apache 2.0, но в общей таблице встречаются модели других языков под AGPL, LGPL-3.0 и CC-BY-NC-SA 4.0 — перед встраиванием в продукт лицензию конкретной модели нужно проверить. Кроме открытой версии Alpha Cephei предлагает Vosk Enterprise (больше языков, повышенная точность, поддержка, обучение) и Vosk Mobile (iOS и Unity) — цены не опубликованы, условия по запросу.
Насколько живой проект
Последний релиз на GitHub — v0.3.50 от 22 апреля 2024 года, а в PyPI лежит 0.3.45 от декабря 2022 года. Страница установки по-прежнему называет Python 3.5–3.9. Модели при этом продолжают выходить: в мае 2026 года вендор выпустил грузинскую.
Плюсы и минусы Vosk
+Преимущества
- ✓Работает офлайн: звук не уходит на чужой сервер
- ✓Маленькая русская модель весит 45 МБ, а маленьким моделям, по словам вендора, нужно около 300 МБ памяти — они рассчитаны на Raspberry Pi и смартфоны
- ✓Не нужен GPU: вендор ориентирует даже большие модели на процессор
- ✓Код и русские модели под Apache 2.0
- ✓Готовый Docker-сервер для телефонии и веба
- ✓Вендор публикует WER каждой модели по открытым наборам данных
- ✓Сайт, репозиторий и архивы моделей открываются с российского IP (проверка 30.09.2026)
−Недостатки
- ✗Маленькая русская модель ошибается заметно чаще серверной: WER 22,71 против 11,1 на open_stt audiobooks
- ✗На телефонных звонках даже большая модель даёт WER 36,0 (openstt calls) по таблице вендора
- ✗Знаки препинания и заглавные буквы вендор предлагает восстанавливать отдельной моделью recasepunc на 1,6 ГБ
- ✗Последний релиз библиотеки — апрель 2024 года, в PyPI версия декабря 2022-го
- ✗Готовых сборок под CUDA нет, GPU-декодер собирается вручную
- ✗Сборка под iOS выдаётся только по запросу
- ✗У части моделей других языков лицензии AGPL и CC-BY-NC-SA — проверять каждую
Сценарии использования Vosk
Голосовое управление без интернета
Поставить маленькую русскую модель на Raspberry Pi или Android-устройство и распознавать команды умного дома локально, без передачи звука в облако.
Распознавание звонков на своей АТС
Поднять vosk-server из Docker-образа kaldi-ru и подключить его к Asterisk или FreeSWITCH, чтобы получать текст разговоров внутри своей инфраструктуры.
Субтитры и расшифровка лекций
Прогнать записи через серверную модель vosk-model-ru-0.42 на обычном сервере без видеокарты, а знаки препинания расставить моделью recasepunc.
Голосовой ввод в настольном приложении
Встроить библиотеку через привязку для Python, Java или C# и перенастраивать словарь под предметную область прямо во время работы.
Прототип голосового бота
Подключить потоковый API к чат-боту через WebSocket-сервер и получать распознанный текст по мере речи собеседника.
Отзывы о Vosk
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о Vosk
?Какую модель Vosk взять для русского языка?
Для телефона, Raspberry Pi и настольных программ вендор предлагает vosk-model-small-ru-0.22 на 45 МБ. Для расшифровки на сервере — vosk-model-ru-0.42 на 1,8 ГБ: по таблице вендора у неё WER 11,1 на open_stt audiobooks против 22,71 у маленькой. Есть ещё узкополосная серверная vosk-model-ru-0.10 на 2,5 ГБ.
?Нужна ли видеокарта?
Нет. Вендор рассчитывает даже большие модели на процессор: им нужно до 16 ГБ памяти и CPU уровня i7 или AMD Ryzen. Готовых сборок под CUDA Alpha Cephei не выпускает — GPU-декодер можно собрать самостоятельно по Docker-файлам из репозитория vosk-server.
?Ставит ли Vosk знаки препинания?
Для расстановки знаков препинания и заглавных букв вендор предлагает отдельные модели, обученные инструментом recasepunc. Для русского это vosk-recasepunc-ru-0.22 на 1,6 ГБ под Apache 2.0 — её подключают в дополнение к модели распознавания.
?Можно ли использовать Vosk в коммерческом продукте?
Код распространяется под Apache License 2.0, русские модели в таблице вендора — тоже под Apache 2.0. Эта лицензия даёт безвозмездное право воспроизводить, изменять, сублицензировать и распространять код при сохранении текста лицензии и уведомлений, а её патентная часть прямо упоминает продажу. Но у части моделей других языков лицензии AGPL, LGPL-3.0 или CC-BY-NC-SA 4.0 — лицензию берите из таблицы для каждой модели отдельно.
?Как подключить Vosk к телефонии?
Через vosk-server: он работает по WebSocket, gRPC, MQTT и WebRTC и запускается одной командой Docker. На Docker Hub есть готовый образ kaldi-ru с русской моделью. README сервера прямо называет АТС Asterisk и FreeSWITCH среди мест применения.
?Обновляется ли проект?
Релизы библиотеки выходят редко: последний на GitHub — v0.3.50 от 22 апреля 2024 года, в PyPI лежит 0.3.45 от декабря 2022-го, а страница установки называет Python 3.5–3.9. Модели выходят и сейчас — грузинскую вендор выпустил в мае 2026 года.
?Чем Vosk Enterprise отличается от открытой версии?
По описанию на сайте Alpha Cephei, Enterprise даёт больше языков, повышенную точность, постоянную поддержку и обучение технологии, а Vosk Mobile — работу на iOS и в Unity. Цен на сайте нет, условия обсуждаются по запросу через форму или e-mail.
Альтернативы Vosk
Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.
Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.
Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.
Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.
Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.
Обновлено: 30 сентября 2026 г.