01 Was passiert ist

Microsoft hat drei MAI-Modelle in Microsoft Foundry angekündigt: MAI-Transcribe-2-Streaming für die fortlaufende Transkription gesprochener Sprache, MAI-Voice-2.1 für mehrsprachige Sprachausgabe und MAI-Voice-2.1-Flash für reaktionsschnelle Sprachanwendungen mit hohem Aufkommen. Alle drei sind über Azure Speech und direkt per API in Microsoft Foundry verfügbar.

02 Die wichtigsten Details

  • MAI-Transcribe-2-Streaming transkribiert fortlaufend in 60 Sprachen und erkennt die Sprache automatisch. Erste Teilhypothesen erscheinen innerhalb der ersten wenigen hundert Millisekunden nach Eingang des Audios; ein stabiles Transkript wird am Ende der Äußerung festgeschrieben.
  • Nach Angaben von Microsoft startete das Modell auf Platz 1 bei der Genauigkeit von Teil- und Endtranskripten im Artificial-Analysis-Ranking. In den meisten Fällen erscheinen Wörter bereits 320 Millisekunden nach dem Sprechen im Text; beim nächsten Wettbewerber dauert es mehr als 500 Millisekunden.
  • MAI-Voice-2.1 erzeugt Sprache in 23 Sprachen und bewahrt die Stimmidentität über unterstützte Sprachen hinweg. Laut einem von Microsoft der ElevenLabs-Dokumentation zugeordneten Vergleich ist Flash 55 Prozent schneller und 60 Prozent günstiger als Konkurrenzmodelle seiner Klasse.
  • Der Einführungspreis für MAI-Transcribe-2-Streaming beträgt bis zum Jahresende 0,54 US-Dollar pro Audio-Stunde. MAI-Voice-2.1 kostet 22 US-Dollar pro 1 Million Zeichen, MAI-Voice-2.1-Flash 15 US-Dollar pro 1 Million Zeichen. OpenRouter, Vercel und LiveKit sind nur als geplante Plattformen genannt.

03 Warum das wichtig ist

Entwickler können Streaming-Transkription mit ersten Teilergebnissen innerhalb der ersten wenigen hundert Millisekunden mit einem von zwei Sprachsynthese-Modellen kombinieren. Die veröffentlichten Preise pro Audio-Stunde und pro 1 Million Zeichen helfen bei der Kostenplanung. Microsofts Leistungsangaben sind hier nicht unabhängig überprüft.

04 Für wen es relevant ist

Entwickler von Sprachschnittstellen, Entwickler von Service-Anwendungen, Entwickler von KI-Agenten und Teams, die TTS-Modelle auswählen.

OriginalquelleMicrosoft