01 发生了什么

2026 年 9 月 10 日,OpenAI 宣布 GPT-Live-1 模型接入 API,支持全双工语音对话,系统可同步完成语音输入接收与输出生成。

02 关键细节

  • 模型具备原生语音中断与停顿管理能力,支持将复杂逻辑推理及工具调用委托给后端模型处理。
  • 开发者可通过系统指令精确调节语音智能体的语气、语速与对话风格,适用于构建电话自动化工作流。
  • 语音层定价为 0.05 美元/分钟,后端模型调用与工具使用产生的费用需额外计算。
  • OpenAI 称,在 Speak 的早期评估中,相比此前的轮流对话系统,GPT-Live-1 在学习者思考停顿时主动打断的次数减少了近 80%。

03 为什么重要

开发者可以用它构建能处理停顿和插话的语音应用,并把复杂推理交给后端模型。评估总成本时,还需计入后端模型与工具费用。

04 适合谁

软件开发人员及语音系统工程师。

原始来源OpenAI