TBank VoiceKit STT
нейросеть
TBank VoiceKit STT — модель распознавания речи от российского вендора Т-Банк: переводит голос в текст, размечает реплики по спикерам и ставит тайм-коды, из которых собираются субтитры и протоколы встреч
Макс. длина ответа
(в токенах)
Размер контекста
(в токенах)
Стоимость промпта
(за 1M токенов)
Как работает TBank VoiceKit STT?
Профиль узкий и потому сильный: русская разговорная речь, телефонные записи, шум и перебивания — там, где универсальные зарубежные распознаватели спотыкаются на именах и терминах. В отличие от текстовых чат-моделей вроде GPT или Claude, здесь на входе аудио, а на выходе готовая расшифровка, которую можно тут же отдать любой нейросети для текста: сжать встречу в саммари, вытащить задачи, перевести. В BotHub это работает без VPN и зарубежной карты: оплата российской картой в рублях по факту, без подписки, токены и капсы не сгорают. Рядом в одном окне — GPT на русском, Claude, Midjourney, Suno и модели озвучки текста, переключение между ними не требует переписывать интеграцию: единый OpenAI-совместимый API, шифрование AES-GCM, данные не сохраняются. Сценарии: расшифровка созвонов и интервью, субтитры к видео и курсам, контроль качества в колл-центре, поиск по архиву звонков, надиктовка заметок.Частые вопросы о TBank VoiceKit STT
Вы можете использовать результаты генерации в коммерческих целях. Все права на созданный контент принадлежат вам. Единственное ограничение: убедитесь, что в запросе не использовались защищённые авторским правом материалы третьих сторон. Ответственность за соблюдение прав на входные данные лежит на пользователе.
voicekit-stt — модель распознавания речи от T-Bank VoiceKit: она переводит аудио в текст, в том числе длинные записи. Подойдёт для расшифровки совещаний, интервью, звонков и подкастов, подготовки заметок и черновиков субтитров. Доступ из России без VPN и зарубежной карты, оплата рублями.
За один ответ модель отдаёт до 4096 токенов текста, контекст — 4095 токенов. Этого хватает на расшифровку фрагмента записи; если аудио длинное, разбивайте его на части и склеивайте результаты либо обрабатывайте пачками через API.
Пошаговые рассуждения в наших данных не отмечены, и для этой задачи они не главное: voicekit-stt заточена на точную расшифровку речи, а не на размышления. Если нужны анализ, выводы или саммари по готовому тексту, передайте расшифровку любой текстовой модели в BotHub.
Вызов функций и структурированный вывод JSON в наших данных не отмечены. На выходе вы получаете распознанный текст. Если нужна структура — поля, теги, таблица — отправьте расшифровку в текстовую модель через единый OpenAI-совместимый API BotHub, не переписывая интеграцию.
Аудио — да, это основной вход: модель принимает записи, включая большие файлы. Приём изображений и видео в наших данных не отмечен, поэтому рассчитывайте на звуковые дорожки. Если нужна работа с картинками или видео, переключитесь на другую модель в том же окне.
Это разработка российского вендора T-Bank VoiceKit, и сервис создавался под задачи русскоязычного распознавания речи. Точные метрики качества мы не публикуем, поэтому лучший способ — прогнать свои записи: созвон, интервью, звонок — и сравнить расшифровку с другими моделями в BotHub.