01 Was passiert ist
Am 10. September 2026 stellte OpenAI das Modell GPT-Live-1 für die API bereit, um Vollduplex-Sprachkonversationen mit gleichzeitiger Ein- und Ausgabe zu ermöglichen.
02 Die wichtigsten Details
- Das Modell verwaltet Unterbrechungen und Pausen direkt, während es komplexere Schlussfolgerungen und Werkzeugaufrufe an ein Backend-Modell delegiert.
- Über Systemanweisungen steuern Entwickler Tonfall, Sprechgeschwindigkeit und Stil der Sprachagenten für Telefonanwendungen.
- Die Kosten für den Sprachlayer belaufen sich auf 0,05 USD pro Minute; Backend-Modelle werden separat berechnet.
- Nach Angaben von OpenAI zeigten erste Speak-Evaluierungen eine Reduzierung der Unterbrechungen während Denkpausen um nahezu 80% gegenüber älteren turn-basierten Systemen.
03 Warum das wichtig ist
Die Architektur ermöglicht die Entwicklung von Sprachagenten, die durch ihre Fähigkeit zur nativen Pausen- und Unterbrechungsverwaltung flüssigere Dialoge führen können.
04 Für wen es relevant ist
Softwareentwickler und Ingenieure für Sprachsysteme.
OriginalquelleOpenAI