01 发生了什么
微软宣布在Microsoft Foundry推出三款MAI模型:用于流式语音转写的MAI-Transcribe-2-Streaming、多语言文本转语音模型MAI-Voice-2.1,以及面向响应迅速、高用量语音应用的MAI-Voice-2.1-Flash。三款模型均可通过Azure Speech及Microsoft Foundry直接API访问。
02 关键细节
- MAI-Transcribe-2-Streaming支持60种语言的连续转写和自动语种检测。收到音频后数百毫秒内会输出首批部分假设,并在语句结束时提交稳定文本。
- 微软称,该模型在Artificial Analysis排行榜的部分转写和最终转写准确率上均位列第一。在多数情况下,词语会在说出后最早320毫秒出现在转写文本中;最接近的竞品则需要超过500毫秒。
- MAI-Voice-2.1可生成23种语言的语音,并在受支持的语言间保持一致的声音身份。微软提供并归因于ElevenLabs文档的对比称,MAI-Voice-2.1-Flash比同类竞品快55%、便宜60%。
- MAI-Transcribe-2-Streaming的引入价格为每小时音频0.54美元,适用至年底;MAI-Voice-2.1为每百万字符22美元,MAI-Voice-2.1-Flash为每百万字符15美元。OpenRouter、Vercel和LiveKit仅被列为计划接入的平台。
03 为什么重要
开发者可将能在数百毫秒内返回首批部分转写的流式识别,与两款语音合成模型搭配使用。按音频小时和每百万字符计价的价格已经公布,可用于估算成本。微软公布的性能数据尚未在此得到独立验证。
04 适合谁
语音界面开发人员、服务应用开发人员、人工智能代理开发人员及选择TTS模型的团队。
原始来源Microsoft