Перейти к содержимому
T

T-one

Бесплатный тариф

Открытый потоковый распознаватель русской речи от Т-Банка, заточенный под телефонные звонки: модель на 71 млн параметров обрабатывает звук 8 кГц кусками по 300 мс и отдаёт готовые фразы в реальном времени. Для разработчиков колл-центров и голосовых ботов.

github.com/voicekit-team/T-one

Основная информация

Страна
Россия
Языки
Английский, Русский
Поддержка
Issues на GitHub
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Разработчик
ООО «ТЦР» (в английском README — T-Software DC), модель представлена в блоге Т-Банка
Лицензия
Apache License 2.0 (код и модели)
Открытый исходный код
Да — код на GitHub, веса на Hugging Face
Коммерческое использование
Разрешено: в статье Т-Банка — «как в своих личных целях, так и в коммерческих»
Архитектура модели
Conformer с SwiGLU, RMSNorm, RoPE и U-Net-структурой, обучение с CTC
Размеры модели
71 млн параметров
Объём обучающих данных
Более 80 000 часов русской речи, из них 57,9 тыс. часов телефонии
Языки распознавания
Русский
Частота дискретизации
8 кГц
Streaming-режим
Да — куски по 300 мс с сохранением состояния между ними
Точность распознавания (WER)
Колл-центр — 8,63 %, прочая телефония — 6,20 %, именованные сущности — 5,83 %, CommonVoice 19 test — 5,32 %, OpenSTT asr_calls_2_val: переразмеченный — 7,94 %, исходный — 20,27 %
Автопунктуация
Нет — алфавит модели: русские буквы, пробел и служебный символ
Тайм-коды
Таймкоды фраз
Поддерживаемые аудиоформаты
WAV, MP3, FLAC, OGG
Требования к железу
Для демо — не меньше 4 ядер CPU и 8 ГБ памяти (рекомендация разработчиков)
GPU-ускорение
Экспорт в TensorRT: T4 — 1 786, A100 — 7 833, H100 — 17 203 секунд аудио в секунду
Платформы
Linux и macOS; Windows — через Docker или WSL
Требования
Python 3.9 или новее, Poetry 2.1 или новее
Docker-образ
tinkoffcreditsystems/t-one:0.1.0
Дообучение моделей
Дообучение на своих данных через Hugging Face Trainer
Телефония
Основной домен модели — телефонные звонки
Дата первого выпуска
Июль 2025
Репозиторий
GitHub: voicekit-team/T-one

Обзор T-one

Что такое T-one

T-one — готовый конвейер потокового распознавания русской речи, который Т-Банк выложил в открытый доступ летом 2025 года. В README разработчиком названо ООО «ТЦР» (в английской версии — T-Software DC), а подробный разбор модели опубликован в блоге Т-Банка на Хабре. Код и модель распространяются под Apache 2.0; в статье сказано, что их можно использовать «как в своих личных целях, так и в коммерческих».

Модель специализирована на телефонном канале с частотой дискретизации 8 кГц. По словам разработчиков, обучение на разнородных данных делает её пригодной и за пределами телефонии.

Как устроен конвейер

  • Акустическая модель — Conformer на 71 млн параметров, обработка кусками по 300 мс с сохранением контекста между ними
  • Разделитель фраз — по вероятностям символов находит начало и конец фразы
  • Декодер — жадный или лучевой поиск с языковой моделью KenLM

На выходе — текст фраз с таймкодами. Модель обучена с нуля на более чем 80 000 часах русской речи, из них 57,9 тыс. часов — телефония; обучение шло семь дней на восьми A100 средствами фреймворка NVIDIA NeMo.

Точность

В таблице README у T-one WER 8,63 % на записях колл-центра, 6,20 % на прочей телефонии, 5,83 % на именованных сущностях и 7,94 % на переразмеченном OpenSTT asr_calls_2_val (на исходной разметке того же набора — 20,27 % против 20,07 % у GigaAM-RNNT v2). В той же таблице GigaAM-RNNT v2 даёт 10,22 % на колл-центре, а Whisper large-v3 — 19,39 %. На чтении из CommonVoice 19 T-one уступает: 5,32 % против 2,68 % у GigaAM-RNNT v2. Сравнение проведено самими разработчиками T-one.

Как запустить

Быстрее всего — демо в Docker: одна команда поднимает веб-интерфейс на порту 8080, где можно распознать файл или речь с микрофона. Для плавной работы разработчики советуют компьютер минимум с 4 ядрами CPU и 8 ГБ памяти. Для встраивания в свой код нужен Python 3.9 или новее и Poetry на Linux или macOS; на Windows — через Docker или WSL, потому что у KenLM нет официальной поддержки Windows. Поддерживаются файлы WAV, MP3, FLAC и OGG.

Для высокой нагрузки модель экспортируется в TensorRT и запускается в Triton Inference Server. По замерам разработчиков, на видеокарте T4 она обрабатывает 1 786 секунд аудио в секунду, на A100 — 7 833, на H100 — 17 203. Модель можно дообучить на своих звонках через экосистему Hugging Face.

Чем отличается от VoiceKit

T-one — открытая модель, которую разворачивают на своих серверах бесплатно. VoiceKit — отдельный продукт: облачный API распознавания и синтеза речи Т-Банка.

Плюсы и минусы T-one

+Преимущества

  • ✓На звонках колл-центра по таблице разработчиков — самый низкий WER из сравнённых: 8,63 %
  • ✓Компактная модель на 71 млн параметров, демо рассчитано на обычный CPU с 8 ГБ памяти
  • ✓Apache 2.0 — коммерческое использование разрешено прямо
  • ✓Готовый потоковый конвейер, а не только веса модели
  • ✓Запуск демо одной командой Docker
  • ✓Опубликована производительность на T4, A30, A100 и H100

−Недостатки

  • ✗Только русский язык
  • ✗Выдаёт текст без знаков препинания: алфавит модели — русские буквы и пробел
  • ✗На чтении из CommonVoice 19 уступает GigaAM-RNNT v2: 5,32 % против 2,68 %
  • ✗Сравнение с другими моделями проведено самими разработчиками T-one
  • ✗На Windows работает только через Docker или WSL из-за KenLM
  • ✗Нумерованных релизов нет, последний коммит — декабрь 2025 года

Сценарии использования T-one

1

Распознавание звонков колл-центра в реальном времени

Передавать звук разговора кусками по 300 мс и получать готовые фразы с таймкодами, пока клиент ещё говорит, — для подсказок оператору или контроля качества.

2

Голосовой бот на телефонной линии

Подключить потоковый конвейер к боту: модель рассчитана на звук 8 кГц и сама определяет, где закончилась фраза собеседника.

3

Массовая расшифровка записей разговоров

Экспортировать модель в TensorRT, поднять Triton Inference Server на видеокарте и прогонять архив звонков пакетами.

4

Быстрая проверка на своих записях

Запустить демо одной командой Docker на обычном компьютере и загрузить в веб-интерфейс несколько своих звонков, прежде чем встраивать модель.

5

Дообучение под свою лексику

Дообучить модель на размеченных звонках с названиями своих продуктов и терминами по примеру из репозитория.

Отзывы о T-one

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о T-one

?Можно ли использовать T-one в коммерческом продукте?

Да. Код и модель распространяются под Apache 2.0, а в статье Т-Банка на Хабре прямо сказано, что их можно использовать «как в своих личных целях, так и в коммерческих».

?Подходит ли T-one для обычных записей, а не звонков?

Модель заточена под телефонный канал с частотой 8 кГц. Разработчики пишут, что благодаря разнородным обучающим данным она устойчива и в других доменах. Но на чтении из CommonVoice 19 по их же таблице T-one ошибается чаще GigaAM-RNNT v2: 5,32 % против 2,68 %. Для диктовок и видео стоит сравнить модели на своих записях.

?Какое железо нужно?

Для демо разработчики советуют компьютер минимум с 4 ядрами CPU и 8 ГБ памяти — видеокарта не обязательна. Для большой нагрузки модель экспортируется в TensorRT: на T4 она обрабатывает 1 786 секунд аудио в секунду, на A100 — 7 833.

?Ставит ли T-one знаки препинания?

Нет. Алфавит модели — русские буквы, пробел и служебный символ, поэтому на выходе текст без знаков препинания. Если нужны знаки препинания, текст придётся обрабатывать отдельной моделью.

?Чем T-one отличается от T-Bank VoiceKit?

T-one — открытая модель, которую бесплатно разворачивают на своих серверах. VoiceKit — облачный API распознавания и синтеза речи Т-Банка. Открытая модель подойдёт, если записи нельзя передавать наружу или нужен полный контроль над развёртыванием.

?Как быстро попробовать модель?

Выполнить docker run -it --rm -p 8080:8080 tinkoffcreditsystems/t-one:0.1.0 и открыть localhost:8080 в браузере: в веб-интерфейсе можно распознать файл WAV, MP3, FLAC или OGG или говорить в микрофон.

Альтернативы T-one

G
GigaAMFreeБесплатно

Семейство открытых акустических моделей SberDevices для распознавания русской речи под лицензией MIT. Версия v3 предобучена на 700 тыс. часов речи, варианты e2e сразу ставят пунктуацию, модели экспортируются в ONNX. Для разработчиков, которым нужен распознаватель на своих серверах.

V
VoskFreeБесплатно

Открытый движок распознавания речи от Alpha Cephei, который работает без интернета — от Raspberry Pi и смартфона до сервера. Для русского есть лёгкая модель на 45 МБ и серверные на 1,5–2,5 ГБ, потоковый API и Docker-сервер для телефонии. Для разработчиков голосовых ботов, IoT и офлайн-приложений.

T-Bank VoiceKit
T-Bank VoiceKit

API для распознавания и синтеза речи в реальном времени с потоковым режимом через gRPC и REST. Часть T-API от Т-Банка (бывший Tinkoff VoiceKit). Сервис ООО «ТЦР»: распознавание доступно для ЮЛ и физлиц, синтез — только для ЮЛ.

N
NVIDIA NeMo Speech (Parakeet, Canary)FreeБесплатно

Открытый фреймворк NVIDIA для обучения и запуска речевых моделей и семейство готовых весов: Parakeet v3 и Canary v2 распознают 25 языков, включая русский, ставят пунктуацию и таймкоды, Canary ещё и переводит. Для команд с видеокартами NVIDIA и опытом PyTorch.

Whisper (OpenAI)
Whisper (OpenAI)FreeБесплатно

Open-source модель автоматического распознавания речи (ASR) от OpenAI на архитектуре Transformer encoder-decoder. Обучена на 680 000 часов многоязычных данных, поддерживает транскрипцию и перевод на английский. Доступна как через API OpenAI, так и для self-hosted-запуска.

Обновлено: 30 сентября 2026 г.