Перейти к содержимому
Q

Qwen3-ASR

Бесплатный тариф

Открытые модели распознавания речи от команды Qwen в Alibaba Cloud на 0,6 и 1,7 млрд параметров: 30 языков, включая русский, и 22 диалекта китайского, сами определяют язык и понимают даже пение. Для разработчиков с видеокартами, которым нужен многоязычный распознаватель на своём сервере.

github.com/QwenLM/Qwen3-ASR

Основная информация

Страна
Международный
Языки
Английский
Поддержка
Issues на GitHub, Discord и ещё 1
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Разработчик
Команда Qwen, Alibaba Cloud
Лицензия
Apache License 2.0 (код и веса)
Открытый исходный код
Да — код на GitHub, веса на Hugging Face и ModelScope
Коммерческое использование
Apache 2.0 даёт безвозмездную бессрочную лицензию воспроизводить, изменять, сублицензировать и распространять код и веса, а её патентная часть прямо называет продажу («sell»); отдельной оговорки о коммерции в README нет
AI-модели
Qwen3-ASR-1.7B, Qwen3-ASR-0.6B, Qwen3-ForcedAligner-0.6B
Размеры модели
1,7 и 0,6 млрд параметров
Языки распознавания
30 языков, в том числе русский, и 22 диалекта китайского
Определение языка
Да — модели определяют язык записи
Streaming-режим
Да — только в режиме vLLM, без пакетной обработки и таймкодов
Тайм-коды
Через Qwen3-ForcedAligner-0.6B: записи до 5 минут, 11 языков, включая русский
Команда установки
pip install -U qwen-asr
Docker-образ
qwenllm/qwen3-asr (нужны драйвер видеокарты и NVIDIA Container Toolkit)
Требования к железу
Примеры запускают модели на видеокарте NVIDIA; цифр по памяти разработчики не приводят
Требования
Python 3.9 или новее (разработчики предлагают окружение на Python 3.12); FlashAttention 2 — по желанию
Фреймворк
transformers или vLLM
Протоколы API
HTTP-сервер qwen-asr-serve (обёртка над vllm serve), запросы на /v1/chat/completions; в README есть пример клиента на OpenAI SDK
Последняя версия
Пакет qwen-asr 0.0.6 (30.01.2026); поддержка в transformers — 26.06.2026
Дата релиза
29.01.2026
Репозиторий
GitHub: QwenLM/Qwen3-ASR

Обзор Qwen3-ASR

Что такое Qwen3-ASR

Qwen3-ASR — серия открытых моделей распознавания речи, которую команда Qwen из Alibaba Cloud выпустила 29 января 2026 года. В неё входят две модели распознавания — Qwen3-ASR-1.7B и Qwen3-ASR-0.6B — и модель выравнивания текста по звуку Qwen3-ForcedAligner-0.6B. В основе моделей распознавания — мультимодальная Qwen3-Omni. Код и веса распространяются под Apache License 2.0.

Модели определяют язык записи и распознают 52 языка и диалекта: 30 языков, среди которых русский, и 22 диалекта китайского. Кроме обычной речи они рассчитаны на пение и песни с фоновой музыкой.

Две модели — два компромисса

  • Qwen3-ASR-1.7B — старшая модель. Разработчики пишут, что по их экспериментам она опережает другие открытые модели и конкурирует с сильнейшими коммерческими API
  • Qwen3-ASR-0.6B — облегчённая: README называет её компромиссом точности и эффективности и пишет, что при 128 параллельных запросах она достигает «2000 times throughput»
  • Qwen3-ForcedAligner-0.6B — ставит таймкоды для произвольных единиц текста в записи длиной до 5 минут на 11 языках, в том числе на русском

Отдельных цифр WER для русского в README нет — точность приведена средними значениями по группам языков, поэтому качество на русских записях стоит проверить самостоятельно.

Как запустить

Основной путь — Python-пакет qwen-asr из PyPI. У него два режима работы: через transformers и через vLLM. Второй быстрее и нужен для потокового распознавания; при этом в потоковом режиме нельзя обрабатывать записи пачкой и получать таймкоды. На входе принимаются путь к файлу, URL, данные base64 или массив с частотой дискретизации. Для экономии видеопамяти разработчики советуют FlashAttention 2, он работает только с моделями в float16 или bfloat16.

Команда qwen-asr-serve — обёртка над vllm serve: она поднимает сервер, который принимает запросы на /v1/chat/completions; в разделе о vLLM README показывает и клиент на OpenAI SDK. Команда qwen-asr-demo запускает веб-интерфейс на Gradio. Есть и готовый Docker-образ: для него нужны драйвер видеокарты и NVIDIA Container Toolkit. Все примеры в README запускают модели на видеокарте; работу на процессоре разработчики не описывают.

Облачный вариант

Qwen3-ASR доступна и в облаке: в README есть раздел о DashScope API в Alibaba Cloud Model Studio — для распознавания в реальном времени и расшифровки файлов. Это отдельный сервис со своими условиями, а открытые веса можно запускать на своём сервере бесплатно.

Плюсы и минусы Qwen3-ASR

+Преимущества

  • ✓Лицензия Apache 2.0 на код и веса
  • ✓Русский в списке поддерживаемых языков из коробки
  • ✓Одна модель и для записей, и для потокового распознавания
  • ✓Понимает пение и речь на фоне музыки
  • ✓Установка одной командой pip и готовый Docker-образ
  • ✓Сервер на vLLM принимает запросы на /v1/chat/completions, в README есть пример клиента на OpenAI SDK

−Недостатки

  • ✗Нет отдельных цифр WER для русского — точность на своих записях придётся проверять
  • ✗Примеры и Docker рассчитаны на видеокарту NVIDIA, про работу на процессоре ничего не сказано
  • ✗Потоковый режим — только через vLLM, без пакетной обработки и таймкодов
  • ✗Таймкоды — отдельной моделью и только для записей до 5 минут
  • ✗Пакет qwen-asr в PyPI не обновлялся с 30 января 2026 года (версия 0.0.6), релизов на GitHub нет
  • ✗Из 52 заявленных вариантов 22 — диалекты китайского, самих языков — 30

Сценарии использования Qwen3-ASR

1

Многоязычная расшифровка записей

Распознавать записи на русском, английском, китайском и других поддерживаемых языках одной моделью, не указывая язык заранее.

2

Тексты песен и видео с музыкой

Получать текст из клипов и роликов, где речь или пение идут на фоне музыки: разработчики заявляют поддержку пения и песен с фоновой музыкой.

3

Замена облачного API своим сервером

Поднять qwen-asr-serve на своей видеокарте и слать запросы на его /v1/chat/completions — в README для такого сервера есть пример клиента на OpenAI SDK.

4

Субтитры с точными таймкодами

Распознать запись и выровнять текст по звуку моделью Qwen3-ForcedAligner, чтобы получить таймкоды слов для субтитров к фрагментам до 5 минут.

5

Потоковое распознавание в голосовом приложении

Запустить модель в режиме vLLM и получать текст по мере речи пользователя.

Отзывы о Qwen3-ASR

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о Qwen3-ASR

?Поддерживает ли Qwen3-ASR русский язык?

Да, русский есть в списке 30 языков, которые распознают обе модели — 1,7B и 0,6B. Модель выравнивания Qwen3-ForcedAligner тоже поддерживает русский. Отдельных цифр точности для русского в README нет — только средние по группам языков, поэтому качество стоит проверить на своих записях.

?Какую модель выбрать — 1,7B или 0,6B?

Старшая 1,7B — ради точности: разработчики пишут, что она конкурирует с сильнейшими коммерческими API. Младшая 0,6B — ради скорости и нагрузки: README называет её компромиссом точности и эффективности и пишет, что при 128 параллельных запросах она достигает «2000 times throughput». Средний WER обеих моделей по группам языков приведён в README — сравните их на своих записях.

?Можно ли запустить без видеокарты?

В README такой сценарий не описан: все примеры загружают модель на видеокарту, режим vLLM использует видеопамять, а Docker-образ требует драйвер GPU и NVIDIA Container Toolkit. Рассчитывайте на сервер с видеокартой NVIDIA.

?Как получить таймкоды слов?

Через отдельную модель Qwen3-ForcedAligner-0.6B: она выравнивает текст по звуку и ставит таймкоды для записей длиной до 5 минут на 11 языках, включая русский. В потоковом режиме таймкоды недоступны.

?Можно ли использовать модели в коммерческом продукте?

Код и веса распространяются под Apache License 2.0 — это указано и в репозитории, и в карточке модели на Hugging Face. Лицензия даёт безвозмездное право воспроизводить, изменять, сублицензировать и распространять их при сохранении текста лицензии и уведомлений об авторстве, а её патентная часть прямо упоминает продажу.

?Чем открытые модели отличаются от DashScope API?

Открытые веса запускаются на вашем сервере бесплатно, записи не покидают вашу инфраструктуру. DashScope API в Alibaba Cloud Model Studio — облачный доступ к Qwen3-ASR для распознавания в реальном времени и расшифровки файлов, со своими условиями.

Альтернативы Qwen3-ASR

Whisper (OpenAI)
Whisper (OpenAI)FreeБесплатно

Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.

N
NVIDIA NeMo Speech (Parakeet, Canary)FreeБесплатно

Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.

G
GigaAMFreeБесплатно

Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.

V
VoskFreeБесплатно

Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.

T
T-oneFreeБесплатно

Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.

Обновлено: 30 сентября 2026 г.