T-one
Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.
Основная информация
Технические характеристики
- Разработчик
- ООО «ТЦР» (в английском README — T-Software DC), модель представлена в блоге Т-Банка
- Лицензия
- Apache License 2.0 (код и модели)
- Открытый исходный код
- Да — код на GitHub, веса на Hugging Face
- Коммерческое использование
- Разрешено: в статье Т-Банка — «как в своих личных целях, так и в коммерческих»
- Архитектура модели
- Conformer с SwiGLU, RMSNorm, RoPE и U-Net-структурой, обучение с CTC
- Размеры модели
- 71 млн параметров
- Объём обучающих данных
- Более 80 000 часов русской речи, из них 57,9 тыс. часов телефонии
- Языки распознавания
- Русский
- Частота дискретизации
- 8 кГц
- Streaming-режим
- Да — куски по 300 мс с сохранением состояния между ними
- Точность распознавания (WER)
- Колл-центр — 8,63 %, прочая телефония — 6,20 %, именованные сущности — 5,83 %, CommonVoice 19 test — 5,32 %, OpenSTT asr_calls_2_val: переразмеченный — 7,94 %, исходный — 20,27 %
- Автопунктуация
- Нет — алфавит модели: русские буквы, пробел и служебный символ
- Тайм-коды
- Таймкоды фраз
- Поддерживаемые аудиоформаты
- WAV, MP3, FLAC, OGG
- Требования к железу
- Для демо — не меньше 4 ядер CPU и 8 ГБ памяти (рекомендация разработчиков)
- GPU-ускорение
- Экспорт в TensorRT: T4 — 1 786, A100 — 7 833, H100 — 17 203 секунд аудио в секунду
- Платформы
- Linux и macOS; Windows — через Docker или WSL
- Требования
- Python 3.9 или новее, Poetry 2.1 или новее
- Docker-образ
- tinkoffcreditsystems/t-one:0.1.0
- Дообучение моделей
- Дообучение на своих данных через Hugging Face Trainer
- Телефония
- Основной домен модели — телефонные звонки
- Дата первого выпуска
- Июль 2025
- Репозиторий
- GitHub: voicekit-team/T-one
Обзор T-one
Что такое T-one
T-one — готовый конвейер потокового распознавания русской речи, который Т-Банк выложил в открытый доступ летом 2025 года. В README разработчиком названо ООО «ТЦР» (в английской версии — T-Software DC), а подробный разбор модели опубликован в блоге Т-Банка на Хабре. Код и модель распространяются под Apache 2.0; в статье сказано, что их можно использовать «как в своих личных целях, так и в коммерческих».
Модель специализирована на телефонном канале с частотой дискретизации 8 кГц. По словам разработчиков, обучение на разнородных данных делает её пригодной и за пределами телефонии.
Как устроен конвейер
- Акустическая модель — Conformer на 71 млн параметров, обработка кусками по 300 мс с сохранением контекста между ними
- Разделитель фраз — по вероятностям символов находит начало и конец фразы
- Декодер — жадный или лучевой поиск с языковой моделью KenLM
На выходе — текст фраз с таймкодами. Модель обучена с нуля на более чем 80 000 часах русской речи, из них 57,9 тыс. часов — телефония; обучение шло семь дней на восьми A100 средствами фреймворка NVIDIA NeMo.
Точность
В таблице README у T-one WER 8,63 % на записях колл-центра, 6,20 % на прочей телефонии, 5,83 % на именованных сущностях и 7,94 % на переразмеченном OpenSTT asr_calls_2_val (на исходной разметке того же набора — 20,27 % против 20,07 % у GigaAM-RNNT v2). В той же таблице GigaAM-RNNT v2 даёт 10,22 % на колл-центре, а Whisper large-v3 — 19,39 %. На чтении из CommonVoice 19 T-one уступает: 5,32 % против 2,68 % у GigaAM-RNNT v2. Сравнение проведено самими разработчиками T-one.
Как запустить
Быстрее всего — демо в Docker: одна команда поднимает веб-интерфейс на порту 8080, где можно распознать файл или речь с микрофона. Для плавной работы разработчики советуют компьютер минимум с 4 ядрами CPU и 8 ГБ памяти. Для встраивания в свой код нужен Python 3.9 или новее и Poetry на Linux или macOS; на Windows — через Docker или WSL, потому что у KenLM нет официальной поддержки Windows. Поддерживаются файлы WAV, MP3, FLAC и OGG.
Для высокой нагрузки модель экспортируется в TensorRT и запускается в Triton Inference Server. По замерам разработчиков, на видеокарте T4 она обрабатывает 1 786 секунд аудио в секунду, на A100 — 7 833, на H100 — 17 203. Модель можно дообучить на своих звонках через экосистему Hugging Face.
Чем отличается от VoiceKit
T-one — открытая модель, которую разворачивают на своих серверах бесплатно. VoiceKit — отдельный продукт: облачный API распознавания и синтеза речи Т-Банка.
Плюсы и минусы T-one
+Преимущества
- ✓На звонках колл-центра по таблице разработчиков — самый низкий WER из сравнённых: 8,63 %
- ✓Компактная модель на 71 млн параметров, демо рассчитано на обычный CPU с 8 ГБ памяти
- ✓Apache 2.0 — коммерческое использование разрешено прямо
- ✓Готовый потоковый конвейер, а не только веса модели
- ✓Запуск демо одной командой Docker
- ✓Опубликована производительность на T4, A30, A100 и H100
−Недостатки
- ✗Только русский язык
- ✗Выдаёт текст без знаков препинания: алфавит модели — русские буквы и пробел
- ✗На чтении из CommonVoice 19 уступает GigaAM-RNNT v2: 5,32 % против 2,68 %
- ✗Сравнение с другими моделями проведено самими разработчиками T-one
- ✗На Windows работает только через Docker или WSL из-за KenLM
- ✗Нумерованных релизов нет, последний коммит — декабрь 2025 года
Сценарии использования T-one
Распознавание звонков колл-центра в реальном времени
Передавать звук разговора кусками по 300 мс и получать готовые фразы с таймкодами, пока клиент ещё говорит, — для подсказок оператору или контроля качества.
Голосовой бот на телефонной линии
Подключить потоковый конвейер к боту: модель рассчитана на звук 8 кГц и сама определяет, где закончилась фраза собеседника.
Массовая расшифровка записей разговоров
Экспортировать модель в TensorRT, поднять Triton Inference Server на видеокарте и прогонять архив звонков пакетами.
Быстрая проверка на своих записях
Запустить демо одной командой Docker на обычном компьютере и загрузить в веб-интерфейс несколько своих звонков, прежде чем встраивать модель.
Дообучение под свою лексику
Дообучить модель на размеченных звонках с названиями своих продуктов и терминами по примеру из репозитория.
Отзывы о T-one
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о T-one
?Можно ли использовать T-one в коммерческом продукте?
Да. Код и модель распространяются под Apache 2.0, а в статье Т-Банка на Хабре прямо сказано, что их можно использовать «как в своих личных целях, так и в коммерческих».
?Подходит ли T-one для обычных записей, а не звонков?
Модель заточена под телефонный канал с частотой 8 кГц. Разработчики пишут, что благодаря разнородным обучающим данным она устойчива и в других доменах. Но на чтении из CommonVoice 19 по их же таблице T-one ошибается чаще GigaAM-RNNT v2: 5,32 % против 2,68 %. Для диктовок и видео стоит сравнить модели на своих записях.
?Какое железо нужно?
Для демо разработчики советуют компьютер минимум с 4 ядрами CPU и 8 ГБ памяти — видеокарта не обязательна. Для большой нагрузки модель экспортируется в TensorRT: на T4 она обрабатывает 1 786 секунд аудио в секунду, на A100 — 7 833.
?Ставит ли T-one знаки препинания?
Нет. Алфавит модели — русские буквы, пробел и служебный символ, поэтому на выходе текст без знаков препинания. Если нужны знаки препинания, текст придётся обрабатывать отдельной моделью.
?Чем T-one отличается от T-Bank VoiceKit?
T-one — открытая модель, которую бесплатно разворачивают на своих серверах. VoiceKit — облачный API распознавания и синтеза речи Т-Банка. Открытая модель подойдёт, если записи нельзя передавать наружу или нужен полный контроль над развёртыванием.
?Как быстро попробовать модель?
Выполнить docker run -it --rm -p 8080:8080 tinkoffcreditsystems/t-one:0.1.0 и открыть localhost:8080 в браузере: в веб-интерфейсе можно распознать файл WAV, MP3, FLAC или OGG или говорить в микрофон.
Альтернативы T-one
Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.
Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.
API для распознавания и синтеза речи в реальном времени с потоковым режимом через gRPC и REST. Часть T-API от Т-Банка (бывший Tinkoff VoiceKit). Сервис ООО «ТЦР»: распознавание доступно для ЮЛ и физлиц, синтез — только для ЮЛ.
Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.
Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.
Обновлено: 30 сентября 2026 г.