01 Что произошло
10 сентября 2026 года OpenAI предоставила доступ к модели GPT-Live-1 через API для реализации полнодуплексных голосовых диалогов, обеспечивающих одновременное прослушивание и воспроизведение речи.
02 Ключевые детали
- Модель обрабатывает прерывания и паузы внутри голосового слоя, делегируя при этом сложные задачи и вызовы инструментов внешним бэкенд-моделям.
- Разработчики настраивают тон, темп и стиль общения через системные инструкции для интеграции в голосовые агенты и телефонные системы.
- Стоимость голосового слоя составляет 0,05 доллара за минуту; использование бэкенд-моделей и инструментов оплачивается отдельно.
- По данным OpenAI, согласно результатам ранних оценок Speak, количество прерываний во время пауз снизилось почти на 80% по сравнению с пошаговыми системами.
03 Почему это важно
Этот API предоставляет архитектурные возможности для создания естественных голосовых интерфейсов, которые поддерживают непрерывный диалог за счет нативной обработки прерываний и пауз.
04 Кому полезно
Разработчики программного обеспечения и инженеры голосовых систем.
ПервоисточникOpenAI