Qwen3-ASR
Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.
Основная информация
Технические характеристики
- Разработчик
- Команда Qwen, Alibaba Cloud
- Лицензия
- Apache License 2.0 (код и веса)
- Открытый исходный код
- Да — код на GitHub, веса на Hugging Face и ModelScope
- Коммерческое использование
- Apache 2.0 даёт безвозмездную бессрочную лицензию воспроизводить, изменять, сублицензировать и распространять код и веса, а её патентная часть прямо называет продажу («sell»); отдельной оговорки о коммерции в README нет
- AI-модели
- Qwen3-ASR-1.7B, Qwen3-ASR-0.6B, Qwen3-ForcedAligner-0.6B
- Размеры модели
- 1,7 и 0,6 млрд параметров
- Языки распознавания
- 30 языков, в том числе русский, и 22 диалекта китайского
- Определение языка
- Да — модели определяют язык записи
- Streaming-режим
- Да — только в режиме vLLM, без пакетной обработки и таймкодов
- Тайм-коды
- Через Qwen3-ForcedAligner-0.6B: записи до 5 минут, 11 языков, включая русский
- Команда установки
- pip install -U qwen-asr
- Docker-образ
- qwenllm/qwen3-asr (нужны драйвер видеокарты и NVIDIA Container Toolkit)
- Требования к железу
- Примеры запускают модели на видеокарте NVIDIA; цифр по памяти разработчики не приводят
- Требования
- Python 3.9 или новее (разработчики предлагают окружение на Python 3.12); FlashAttention 2 — по желанию
- Фреймворк
- transformers или vLLM
- Протоколы API
- HTTP-сервер qwen-asr-serve (обёртка над vllm serve), запросы на /v1/chat/completions; в README есть пример клиента на OpenAI SDK
- Последняя версия
- Пакет qwen-asr 0.0.6 (30.01.2026); поддержка в transformers — 26.06.2026
- Дата релиза
- 29.01.2026
- Репозиторий
- GitHub: QwenLM/Qwen3-ASR
Обзор Qwen3-ASR
Что такое Qwen3-ASR
Qwen3-ASR — серия открытых моделей распознавания речи, которую команда Qwen из Alibaba Cloud выпустила 29 января 2026 года. В неё входят две модели распознавания — Qwen3-ASR-1.7B и Qwen3-ASR-0.6B — и модель выравнивания текста по звуку Qwen3-ForcedAligner-0.6B. В основе моделей распознавания — мультимодальная Qwen3-Omni. Код и веса распространяются под Apache License 2.0.
Модели определяют язык записи и распознают 52 языка и диалекта: 30 языков, среди которых русский, и 22 диалекта китайского. Кроме обычной речи они рассчитаны на пение и песни с фоновой музыкой.
Две модели — два компромисса
- Qwen3-ASR-1.7B — старшая модель. Разработчики пишут, что по их экспериментам она опережает другие открытые модели и конкурирует с сильнейшими коммерческими API
- Qwen3-ASR-0.6B — облегчённая: README называет её компромиссом точности и эффективности и пишет, что при 128 параллельных запросах она достигает «2000 times throughput»
- Qwen3-ForcedAligner-0.6B — ставит таймкоды для произвольных единиц текста в записи длиной до 5 минут на 11 языках, в том числе на русском
Отдельных цифр WER для русского в README нет — точность приведена средними значениями по группам языков, поэтому качество на русских записях стоит проверить самостоятельно.
Как запустить
Основной путь — Python-пакет qwen-asr из PyPI. У него два режима работы: через transformers и через vLLM. Второй быстрее и нужен для потокового распознавания; при этом в потоковом режиме нельзя обрабатывать записи пачкой и получать таймкоды. На входе принимаются путь к файлу, URL, данные base64 или массив с частотой дискретизации. Для экономии видеопамяти разработчики советуют FlashAttention 2, он работает только с моделями в float16 или bfloat16.
Команда qwen-asr-serve — обёртка над vllm serve: она поднимает сервер, который принимает запросы на /v1/chat/completions; в разделе о vLLM README показывает и клиент на OpenAI SDK. Команда qwen-asr-demo запускает веб-интерфейс на Gradio. Есть и готовый Docker-образ: для него нужны драйвер видеокарты и NVIDIA Container Toolkit. Все примеры в README запускают модели на видеокарте; работу на процессоре разработчики не описывают.
Облачный вариант
Qwen3-ASR доступна и в облаке: в README есть раздел о DashScope API в Alibaba Cloud Model Studio — для распознавания в реальном времени и расшифровки файлов. Это отдельный сервис со своими условиями, а открытые веса можно запускать на своём сервере бесплатно.
Плюсы и минусы Qwen3-ASR
+Преимущества
- ✓Лицензия Apache 2.0 на код и веса
- ✓Русский в списке поддерживаемых языков из коробки
- ✓Одна модель и для записей, и для потокового распознавания
- ✓Понимает пение и речь на фоне музыки
- ✓Установка одной командой pip и готовый Docker-образ
- ✓Сервер на vLLM принимает запросы на /v1/chat/completions, в README есть пример клиента на OpenAI SDK
−Недостатки
- ✗Нет отдельных цифр WER для русского — точность на своих записях придётся проверять
- ✗Примеры и Docker рассчитаны на видеокарту NVIDIA, про работу на процессоре ничего не сказано
- ✗Потоковый режим — только через vLLM, без пакетной обработки и таймкодов
- ✗Таймкоды — отдельной моделью и только для записей до 5 минут
- ✗Пакет qwen-asr в PyPI не обновлялся с 30 января 2026 года (версия 0.0.6), релизов на GitHub нет
- ✗Из 52 заявленных вариантов 22 — диалекты китайского, самих языков — 30
Сценарии использования Qwen3-ASR
Многоязычная расшифровка записей
Распознавать записи на русском, английском, китайском и других поддерживаемых языках одной моделью, не указывая язык заранее.
Тексты песен и видео с музыкой
Получать текст из клипов и роликов, где речь или пение идут на фоне музыки: разработчики заявляют поддержку пения и песен с фоновой музыкой.
Замена облачного API своим сервером
Поднять qwen-asr-serve на своей видеокарте и слать запросы на его /v1/chat/completions — в README для такого сервера есть пример клиента на OpenAI SDK.
Субтитры с точными таймкодами
Распознать запись и выровнять текст по звуку моделью Qwen3-ForcedAligner, чтобы получить таймкоды слов для субтитров к фрагментам до 5 минут.
Потоковое распознавание в голосовом приложении
Запустить модель в режиме vLLM и получать текст по мере речи пользователя.
Отзывы о Qwen3-ASR
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о Qwen3-ASR
?Поддерживает ли Qwen3-ASR русский язык?
Да, русский есть в списке 30 языков, которые распознают обе модели — 1,7B и 0,6B. Модель выравнивания Qwen3-ForcedAligner тоже поддерживает русский. Отдельных цифр точности для русского в README нет — только средние по группам языков, поэтому качество стоит проверить на своих записях.
?Какую модель выбрать — 1,7B или 0,6B?
Старшая 1,7B — ради точности: разработчики пишут, что она конкурирует с сильнейшими коммерческими API. Младшая 0,6B — ради скорости и нагрузки: README называет её компромиссом точности и эффективности и пишет, что при 128 параллельных запросах она достигает «2000 times throughput». Средний WER обеих моделей по группам языков приведён в README — сравните их на своих записях.
?Можно ли запустить без видеокарты?
В README такой сценарий не описан: все примеры загружают модель на видеокарту, режим vLLM использует видеопамять, а Docker-образ требует драйвер GPU и NVIDIA Container Toolkit. Рассчитывайте на сервер с видеокартой NVIDIA.
?Как получить таймкоды слов?
Через отдельную модель Qwen3-ForcedAligner-0.6B: она выравнивает текст по звуку и ставит таймкоды для записей длиной до 5 минут на 11 языках, включая русский. В потоковом режиме таймкоды недоступны.
?Можно ли использовать модели в коммерческом продукте?
Код и веса распространяются под Apache License 2.0 — это указано и в репозитории, и в карточке модели на Hugging Face. Лицензия даёт безвозмездное право воспроизводить, изменять, сублицензировать и распространять их при сохранении текста лицензии и уведомлений об авторстве, а её патентная часть прямо упоминает продажу.
?Чем открытые модели отличаются от DashScope API?
Открытые веса запускаются на вашем сервере бесплатно, записи не покидают вашу инфраструктуру. DashScope API в Alibaba Cloud Model Studio — облачный доступ к Qwen3-ASR для распознавания в реальном времени и расшифровки файлов, со своими условиями.
Альтернативы Qwen3-ASR
Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.
Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.
Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.
Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.
Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.
Обновлено: 30 сентября 2026 г.