2026-10-01 · Microsoft · ИТ и разработка

Microsoft выпустила потоковую STT-модель с точностью 2,5% WER

Microsoft выпустила потоковую STT-модель с точностью 2,5% WER

Microsoft AI запустила MAI-Transcribe-2-Streaming — первую потоковую модель речь-в-текст, которая работает в реальном времени. Модель вышла 1 октября 2026 года вместе с двумя моделями синтеза речи: MAI-Voice-2.1 и MAI-Voice-2.1-Flash. По рейтингу Artificial Analysis, MAI-Transcribe-2-Streaming заняла первое место среди 38 моделей по точности финального и первичного транскрипта.

Система распознаёт 60 языков с автоматическим определением языка, выдаёт первые гипотезы через 100 мс после получения аудио и уточняет их по мере поступления контекста. Слова появляются в два раза быстрее, чем у ближайшего конкурента, что критично для голосовых агентов и живых субтитров.

Источник: MarkTechPost

Что мы знаем о компании Microsoft
основатель
Майк Харрингтон

Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.

Все новости