产品简介
GPT-Live-1 是 OpenAI 于 2026 年 9 月 10 日在 API 中推出的全双工语音模型,此前已先在 ChatGPT 中落地。它由单一模型同时处理语音的输入与输出,可以一边听一边说,实时响应打断和附和,这是它与传统语音转文字加大模型加文字转语音级联架构的本质区别。
级联方案里每一层交接都会增加延迟、丢失时机、上下文或对话节奏,而 GPT-Live-1 在单个模型内统一推理语音的听与说,同时原生支持回合检测,开发者仍可围绕明确的回合边界构建应用。它还能把深度推理和工具调用委派给 GPT-6 Astra 等后端文本模型,语音层保持轻快,重活交给后端。
页面公布的基准成绩显示,其 Full Duplex Bench 相比 GPT-Realtime-2.1 提升 30 个百分点,搭配 GPT-6 Astra 在 Tau3 语音智能体基准排名第一。语言学习应用 Speak 实测思考停顿期间的打断减少近 80%,有客户迁移后代码库简化 80%、删除了 23000 行代码。
核心功能
- 全双工实时交互:单一模型同时推理输入与输出音频,能自然处理打断、附和与停顿,不依赖级联架构的层层交接。
- 推理与工具委派:语音层可把深度推理和工具调用委派给 GPT-6 Astra 等后端模型,也可搭配 Luna 等处理日程安排、订单更新等高流量任务,对话在后台工作期间持续进行。
- 语气与风格可控:开发者通过 system prompt 定制智能体的语气、语速和对话风格,官方新增 12 种声音覆盖更多口音、方言与语言。
- 静默与噪声管理:更好地处理背景噪音和静默,不会在后台执行步骤时大声播报,长会话中的上下文保持与对话质量明显改善。
- 原生转录输出:同时输出 ASR 转录文本与响应文本,字母数字识别能力强,支持关键词偏置,方便业务侧做合规与检索。
- 电话场景支持:支持部署全双工电话语音智能体,餐厅预订、客服接听等真实电话场景已由 Yelp Host 等产品验证。
适合谁用
以下类型的用户会特别受益于 GPT-Live-1:
- 语音客服与预订:全双工电话智能体接听预订和点餐电话,来电者可以说出更完整自然的句子
- 语言学习陪练:Speak 实测思考停顿期间的打断减少近 80%,对话体验接近真人
- 实时语音助手:需要边听边说、随时被打断又能接上的交互场景
- 高流量任务分流:日程安排、订单更新等由语音层搭配轻量后端处理,复杂问题再升级给推理模型
- 企业级语音入口:OpenAI Presence 基于 GPT-Live-1 驱动实时语音交互,面向企业部署
优点亮点
- 全双工架构消除了级联方案的多层延迟与交接损耗
- Full Duplex Bench 相比 GPT-Realtime-2.1 提升 30 个百分点,Tau3 搭配 GPT-6 Astra 排名第一
- 推理与工具调用可委派后端模型,语音层与智能层解耦,架构灵活
- 客户实测迁移后代码库简化 80%、删除 23000 行代码,维护成本大降
- 12 种新声音覆盖更多口音方言,语气风格可通过 prompt 定制
- 原生输出转录文本,方便业务做合规审计与关键词检索
价格与方案
语音前端层定价每分钟 0.05 美元;后端模型与智能体框架由开发者自行选择搭配,费用另计。自定义语音与 OpenAI Presence 企业部署需联系销售。
总结与建议
GPT-Live-1 把语音交互从回合制带进了全双工时代,单模型同时听说的架构让打断、附和这些人类对话里最自然的部分第一次在产品里成立。配合可委派的推理后端,它实际上定义了一种新的语音智能体架构:前端管听说,后端管思考。做语音客服、陪练、实时助手的团队值得认真评估。
版本演进
- GPT-Live-1 上线 API,全双工语音模型开放给开发者 (2026-09-10):此前先在 ChatGPT 落地的全双工语音模型登陆 API:单一模型同时听和说,实时响应打断与附和,可把深度推理与工具调用委派给 GPT-6 Astra 等后端模型。Full Duplex Bench 较 GPT-Realtime-2.1 提升 30 个百分点,语音层定价每分钟 0.05 美元,新增 12 种声音。