01 发生了什么
2026 年 9 月 10 日,OpenAI 宣布 GPT-Live-1 模型接入 API,支持全双工语音对话,系统可同步完成语音输入接收与输出生成。
02 关键细节
- 模型具备原生语音中断与停顿管理能力,支持将复杂逻辑推理及工具调用委托给后端模型处理。
- 开发者可通过系统指令精确调节语音智能体的语气、语速与对话风格,适用于构建电话自动化工作流。
- 语音层定价为 0.05 美元/分钟,后端模型调用与工具使用产生的费用需额外计算。
- OpenAI 称,在 Speak 的早期评估中,相比此前的轮流对话系统,GPT-Live-1 在学习者思考停顿时主动打断的次数减少了近 80%。
03 为什么重要
开发者可以用它构建能处理停顿和插话的语音应用,并把复杂推理交给后端模型。评估总成本时,还需计入后端模型与工具费用。
04 适合谁
软件开发人员及语音系统工程师。
原始来源OpenAI