01 Was passiert ist
Microsoft hat drei MAI-Modelle in Microsoft Foundry angekündigt: MAI-Transcribe-2-Streaming für die fortlaufende Transkription gesprochener Sprache, MAI-Voice-2.1 für mehrsprachige Sprachausgabe und MAI-Voice-2.1-Flash für reaktionsschnelle Sprachanwendungen mit hohem Aufkommen. Alle drei sind über Azure Speech und direkt per API in Microsoft Foundry verfügbar.
02 Die wichtigsten Details
- MAI-Transcribe-2-Streaming transkribiert fortlaufend in 60 Sprachen und erkennt die Sprache automatisch. Erste Teilhypothesen erscheinen innerhalb der ersten wenigen hundert Millisekunden nach Eingang des Audios; ein stabiles Transkript wird am Ende der Äußerung festgeschrieben.
- Nach Angaben von Microsoft startete das Modell auf Platz 1 bei der Genauigkeit von Teil- und Endtranskripten im Artificial-Analysis-Ranking. In den meisten Fällen erscheinen Wörter bereits 320 Millisekunden nach dem Sprechen im Text; beim nächsten Wettbewerber dauert es mehr als 500 Millisekunden.
- MAI-Voice-2.1 erzeugt Sprache in 23 Sprachen und bewahrt die Stimmidentität über unterstützte Sprachen hinweg. Laut einem von Microsoft der ElevenLabs-Dokumentation zugeordneten Vergleich ist Flash 55 Prozent schneller und 60 Prozent günstiger als Konkurrenzmodelle seiner Klasse.
- Der Einführungspreis für MAI-Transcribe-2-Streaming beträgt bis zum Jahresende 0,54 US-Dollar pro Audio-Stunde. MAI-Voice-2.1 kostet 22 US-Dollar pro 1 Million Zeichen, MAI-Voice-2.1-Flash 15 US-Dollar pro 1 Million Zeichen. OpenRouter, Vercel und LiveKit sind nur als geplante Plattformen genannt.
03 Warum das wichtig ist
Entwickler können Streaming-Transkription mit ersten Teilergebnissen innerhalb der ersten wenigen hundert Millisekunden mit einem von zwei Sprachsynthese-Modellen kombinieren. Die veröffentlichten Preise pro Audio-Stunde und pro 1 Million Zeichen helfen bei der Kostenplanung. Microsofts Leistungsangaben sind hier nicht unabhängig überprüft.
04 Für wen es relevant ist
Entwickler von Sprachschnittstellen, Entwickler von Service-Anwendungen, Entwickler von KI-Agenten und Teams, die TTS-Modelle auswählen.