01 Was passiert ist

Am 10. September 2026 stellte OpenAI das Modell GPT-Live-1 für die API bereit, um Vollduplex-Sprachkonversationen mit gleichzeitiger Ein- und Ausgabe zu ermöglichen.

02 Die wichtigsten Details

  • Das Modell verwaltet Unterbrechungen und Pausen direkt, während es komplexere Schlussfolgerungen und Werkzeugaufrufe an ein Backend-Modell delegiert.
  • Über Systemanweisungen steuern Entwickler Tonfall, Sprechgeschwindigkeit und Stil der Sprachagenten für Telefonanwendungen.
  • Die Kosten für den Sprachlayer belaufen sich auf 0,05 USD pro Minute; Backend-Modelle werden separat berechnet.
  • Nach Angaben von OpenAI zeigten erste Speak-Evaluierungen eine Reduzierung der Unterbrechungen während Denkpausen um nahezu 80% gegenüber älteren turn-basierten Systemen.

03 Warum das wichtig ist

Die Architektur ermöglicht die Entwicklung von Sprachagenten, die durch ihre Fähigkeit zur nativen Pausen- und Unterbrechungsverwaltung flüssigere Dialoge führen können.

04 Für wen es relevant ist

Softwareentwickler und Ingenieure für Sprachsysteme.

OriginalquelleOpenAI