01 Что произошло

10 сентября 2026 года OpenAI предоставила доступ к модели GPT-Live-1 через API для реализации полнодуплексных голосовых диалогов, обеспечивающих одновременное прослушивание и воспроизведение речи.

02 Ключевые детали

  • Модель обрабатывает прерывания и паузы внутри голосового слоя, делегируя при этом сложные задачи и вызовы инструментов внешним бэкенд-моделям.
  • Разработчики настраивают тон, темп и стиль общения через системные инструкции для интеграции в голосовые агенты и телефонные системы.
  • Стоимость голосового слоя составляет 0,05 доллара за минуту; использование бэкенд-моделей и инструментов оплачивается отдельно.
  • По данным OpenAI, согласно результатам ранних оценок Speak, количество прерываний во время пауз снизилось почти на 80% по сравнению с пошаговыми системами.

03 Почему это важно

Этот API предоставляет архитектурные возможности для создания естественных голосовых интерфейсов, которые поддерживают непрерывный диалог за счет нативной обработки прерываний и пауз.

04 Кому полезно

Разработчики программного обеспечения и инженеры голосовых систем.

ПервоисточникOpenAI