01 Ce qui s’est passé
Le 10 septembre 2026, OpenAI a rendu disponible GPT-Live-1 via son API pour permettre des conversations vocales full-duplex avec écoute et parole simultanées.
02 Les points essentiels
- Le modèle traite les interruptions et les pauses en interne, tout en déléguant le raisonnement complexe et l'appel d'outils à un modèle backend sélectionné.
- Les développeurs configurent le ton, le rythme et le style via des instructions système pour les agents vocaux et les flux de travail téléphoniques.
- La couche vocale est facturée 0,05 $ par minute, indépendamment des frais liés au modèle backend et à l'utilisation des outils.
- OpenAI rapporte que les évaluations préliminaires Speak ont montré une réduction de près de 80% des interruptions durant les pauses par rapport aux systèmes par tours de parole.
03 Pourquoi c’est important
Cette architecture permet aux développeurs de créer des agents vocaux réactifs et des systèmes téléphoniques capables de maintenir un flux naturel en gérant nativement les interruptions.
04 Pour qui c’est utile
Développeurs de logiciels et ingénieurs des systèmes vocaux.
Source originaleOpenAI