01 Что произошло
Microsoft объявила о трёх моделях MAI в Microsoft Foundry: MAI-Transcribe-2-Streaming для потоковой расшифровки речи, MAI-Voice-2.1 для многоязычного синтеза речи и MAI-Voice-2.1-Flash для отзывчивых приложений с высокой нагрузкой. Все три доступны через Azure Speech и напрямую по API Microsoft Foundry.
02 Ключевые детали
- MAI-Transcribe-2-Streaming непрерывно расшифровывает речь на 60 языках и автоматически определяет язык. Первые частичные гипотезы появляются в течение первых нескольких сотен миллисекунд после получения аудио, а стабильная расшифровка фиксируется после окончания высказывания.
- По данным Microsoft, модель дебютировала на первом месте по точности частичных и итоговых расшифровок в рейтинге Artificial Analysis. В большинстве случаев слова появляются в тексте уже через 320 мс после произнесения, тогда как ближайшему конкуренту требуется более 500 мс.
- MAI-Voice-2.1 генерирует речь на 23 языках, сохраняя идентичность голоса на поддерживаемых языках. Согласно предоставленному сравнению, которое Microsoft связывает с документацией ElevenLabs, MAI-Voice-2.1-Flash на 55% быстрее и на 60% дешевле конкурирующих моделей своего класса.
- Вводная цена MAI-Transcribe-2-Streaming — $0,54 за час аудио до конца года; MAI-Voice-2.1 стоит $22 за 1 млн символов, а MAI-Voice-2.1-Flash — $15 за 1 млн символов. OpenRouter, Vercel и LiveKit названы только среди платформ, где модели планируют сделать доступными.
03 Почему это важно
Разработчики голосовых агентов могут использовать потоковую транскрибацию с первыми гипотезами в течение первых нескольких сотен миллисекунд и одну из двух моделей синтеза речи. Опубликованные цены за час аудио и за 1 млн символов помогают оценивать расходы; заявления Microsoft о производительности здесь не проверены независимо.
04 Кому полезно
Разработчики голосовых интерфейсов, разработчики сервисных приложений, разработчики AI-агентов и команды, выбирающие TTS-модели.