01 Ce qui s’est passé

Microsoft a annoncé trois modèles MAI dans Microsoft Foundry : MAI-Transcribe-2-Streaming pour la transcription en continu de la parole, MAI-Voice-2.1 pour la synthèse vocale multilingue et MAI-Voice-2.1-Flash pour les applications vocales réactives à fort volume. Tous trois sont accessibles via Azure Speech et directement par l’API de Microsoft Foundry.

02 Les points essentiels

  • MAI-Transcribe-2-Streaming transcrit en continu dans 60 langues avec détection automatique de la langue. Les premières hypothèses partielles arrivent dans les premières centaines de millisecondes après réception de l’audio ; une transcription stable est fixée à la fin de l’énoncé.
  • Selon Microsoft, le modèle a fait ses débuts à la première place du classement Artificial Analysis pour la précision des transcriptions partielles et finales. Dans la plupart des cas, les mots apparaissent dans le texte dès 320 ms après avoir été prononcés, contre plus de 500 ms pour le concurrent le plus proche.
  • MAI-Voice-2.1 génère de la parole dans 23 langues avec une identité vocale cohérente dans les langues prises en charge. D’après une comparaison fournie que Microsoft attribue à la documentation d’ElevenLabs, MAI-Voice-2.1-Flash est 55 % plus rapide et 60 % moins cher que les modèles concurrents de sa catégorie.
  • Le tarif de lancement de MAI-Transcribe-2-Streaming est de 0,54 dollar par heure d’audio jusqu’à la fin de l’année. MAI-Voice-2.1 coûte 22 dollars par million de caractères et MAI-Voice-2.1-Flash, 15 dollars par million de caractères. OpenRouter, Vercel et LiveKit sont cités uniquement comme plateformes prévues.

03 Pourquoi c’est important

Les développeurs peuvent associer la transcription en flux, dont les premières hypothèses arrivent dans les premières centaines de millisecondes, à l’un des deux modèles de synthèse vocale. Les tarifs publiés par heure d’audio et par million de caractères aident à estimer les coûts. Les performances annoncées par Microsoft ne sont pas vérifiées indépendamment ici.

04 Pour qui c’est utile

Développeurs d'interfaces vocales, développeurs d'applications de service, développeurs d'agents IA et équipes qui sélectionnent des modèles TTS.

Source originaleMicrosoft