一句话总结
2026 年 9 月 10 日,OpenAI 把 GPT-Live-1 从 ChatGPT 搬进了 API:一个全双工(full-duplex)语音模型,能一边听一边说,会等你说完、会接「嗯」「对」这样的回填词、也能在你打断它的时候立刻改口。前端语音层定价 0.05 美元/分钟、按秒计费,复杂推理和工具调用则委派给后端模型(如 GPT-6 Astra)。官方称其 Full Duplex Bench 比 GPT-Realtime-2.1 高出 30 个百分点——语音 Agent 的三段式架构,被压缩成了「一个对话层 + 任意后端」两层。
数据来源
本文事实依据来自:
- OpenAI 官方发布《Build more natural voice experiences with GPT-Live-1 in the API》(2026-09-10)
- OpenAI 官方产品页《Introducing GPT-Live》(2026-07-08)
- OpenAI 开发者文档
developers.openai.com/api/docs/guides/live - OpenAI 开发者社区公告(2026-09-10)
- 客户案例口径:Yelp、Speak、Fin(Intercom)、Cognition、Solace Health 官方引述

图片来源:OpenAI 官方发布页
级联架构的问题,不在模型而在「接力」
上一代语音 Agent 的标准做法是拼装:语音转文字(STT)→ 语言模型推理(LLM)→ 文字转语音(TTS)。听起来合理,做起来每一步都在丢东西:
- 每次交接都有延迟,用户能明显感到「顿一下」;
- 判断「用户说完了吗」变成了一个独立工程问题,做不好就是抢话或者冷场;
- 用户中途打断、改口、停顿思考,三个模型谁负责处理?最后都落到了业务代码里。
GPT-Live-1 的解法是把这一层合起来:用一个模型同时推理输入音频和输出音频。官方在发布页里把三个模型的意图能力全部拿掉,只留一段话:「GPT-Live-1 处理听和说,把更深的推理委派给后端。」
一个数字最能说明这件事的分量:医疗语音平台 Solace Health 的联合创始人兼 CTO Tony Stoyanov 在官方引述里说,相比他们原本的级联方案,GPT-Live-1 让代码库简化了 80%、删掉了 23,000 行代码。

六个新能力,逐个看
官方在发布页里列了这次 API 版的六个重点:
- 打断处理:单模型同时推理输入与输出音频,绕开了链式架构的延迟与脆弱交接;
- 推理与工具调用委派:可以把手上的难题丢给后端文本模型(如 GPT-6 Astra 或第三方模型);
- 语气、语速与风格:通过 system prompt 就能调——这对做品牌语音的团队是刚需;
- 静默上下文管理与背景噪音:不打断对话、也不把每一步都「念」出来;
- 长会话可靠性:改善长时间交互中的上下文保持与对话质量;
- 电话支持(telephony):可以直接部署到电话场景,从订餐订座到客服。
此外还有几个对工程实现很实用的点:GPT-Live-1 原生输出 ASR 转写文本与回复文本,对字母数字的理解更强,支持关键词偏置(keyword biasing)——也就是说「订单号 A7F3-Q9」「邮编 200040」这类内容不需要你自己做后处理纠正。它虽然不是轮次式模型,但原生支持 turn detection,想继续按轮次构建的老代码可以平滑迁移。
「前台负责聊,后台负责想」
这次 API 版最值得琢磨的设计是委派(delegation):语音层不负责「想」,只负责「聊」。
开发者可以按任务性质挑后端——比如用轻量模型处理排期、订单更新这类高频任务,用 Astra 这类强推理模型处理复杂客服问题,再用 Codex 之类的 agent harness 去查仓库、跑代码。官方给出的示例里,对话上下文会通过 delegation_id 传给 Codex,结果以事件形式回填进对话:
import { Codex } from "@openai/codex-sdk";
const thread = new Codex().startThread({
workingDirectory: "./repo",
sandboxMode: "read-only",
approvalPolicy: "never",
});
async function answer(live, delegationId, context) {
const { finalResponse } = await thread.run(
`Answer the latest question using this repo.
Reply in two short spoken sentences.\n${context}`
);
// 把后台结果回填进正在进行的语音会话
live.send({
type: "session.commentary.append",
delegation_id: delegationId,
content: finalResponse,
});
}
代码摘自 OpenAI 官方发布页的示例片段(连接建立与委派处理细节已省略)。
这个结构的含义是:语音延迟和后端推理深度被解耦了。用户不会因为后端在跑一段 30 秒的推理而听到长久的沉默——对话继续,结果准备好了再插进来。对企业架构师来说,这也意味着一件事:语音不再是「买一个端到端黑盒」,而是可以复用现有模型与工具链的一层。

评测:比 GPT-Realtime-2.1 高 30 个百分点
官方给出的几组关键数据:
- Full Duplex Bench:比 GPT-Realtime-2.1 高 30 个百分点,主要提升在轮次切换延迟与交互行为上(覆盖航空、零售、电信三个域的语音客服任务,按 Pass@1 计分、各域等权);
- Tau3(语音 Agent 端到端任务):配 GPT-6 Astra 中档推理强度时排名第 1;
- 另有银行知识检索类评测(97 个任务)、停顿处理、背景人声干扰、轮次切换延迟、口语化工具调用等分项。
客户案例里最直观的是语言学习平台 Speak:他们发现 GPT-Live-1 给了学习者更多思考时间,假打断(interruption)比原来的轮次式系统减少了近 80%。Yelp 的 CTO 则提到,GPT-Live-1 用在 Yelp Host 的订座与点单电话上后,电话处理率有「可观的提升」,而且来电者开始说更完整、更自然的句子——这个细节挺有意思:它说明体验的改善不只体现在机器侧,用户自己也会被「带着」说得更自然。

价格与接入
- 语音层:0.05 美元/分钟,按秒计费;
- 后端模型与工具调用:单独计费(你选什么模型,就按什么模型的价算);
- 声音:从少数几个实时音色扩展为跨口音、方言、语言的更多选择;自定义声音需要联系销售确认资格与流程;
- 企业方案:官方同时提到 OpenAI Presence,面向企业部署可回答问题、使用公司系统、按授权执行动作并转人工的语音 Agent。
按这个价格折算:一通 3 分钟的客服电话,语音层成本约 0.15 美元;如果后端用轻量模型处理,整体大概落在几美分到一美元之间的区间(取决于上下文长度与工具调用次数)。相比自建 STT+LLM+TTS 三段链路,省掉的不只是钱,更是那 23,000 行胶水代码的维护成本。

图片来源:OpenAI 官方发布页(Yelp 演示片段)
和现有语音工具栈怎么选
如果你已经在用第三方语音 Agent 平台,判断标准其实很简单:你要的是「一个能聊的前台」,还是「一整套包含编排、监控、合规的成品」?
| 方案 | 定位 | 适合谁 |
|---|---|---|
| GPT-Live-1 + 自选后端 | 只提供全双工对话层,编排、工具、后端模型全部自选 | 有工程能力、想复用现有 LLM/工具链的团队 |
| Vapi / Retell 等语音 Agent 平台 | 端到端编排 + 号码 + 监控面板 | 想快速上线电话客服、少写代码的团队 |
| ElevenLabs / Cartesia / MiniMax 等 TTS | 只解决「说得好听」 | 已有 ASR 与 LLM、只缺音色的场景 |
GPT-Live-1 的定位更接近第一类:它替代的是「STT + 打断判定 + TTS」这一层,而不是整个 Agent 平台。如果你的业务里已经有一堆工具和模型在跑,这一层能直接插进去;如果你连编排都还没有,仍然需要上面再加一层。
注意事项
- 延迟预算要重新算:语音层再快,后端推理仍会占用时间。委派机制解决的是「不说话就尴尬」,不是「结果变快」。
- 电话场景的合规是硬约束:录音告知、号码资质、地区法规都会落到你自己头上,OpenAI 只提供技术能力。
- 成本与上下文长度强相关:委派给大模型做长推理时,后端账单可能远超每分钟 0.05 美元,上线前务必用真实话术压测。
- 评测口径同样是厂商自跑:+30 个百分点、第 1 名都来自 OpenAI 自己的评测,Speak 的 -80% 也是「早期评测」口径。做决策前,请用你自己的场景跑一轮。
- 自定义音色需要申请:不是开箱即用,别把它排进没有 buffer 的排期里。
总结
- GPT-Live-1 进 API 的意义,是把语音 Agent 从三段式级联压成一个对话层;
- 定价 0.05 美元/分钟(按秒计费),真正的成本变量转移到你选的后端模型;
- 委派机制让「听说的延迟」和「推理的深度」解耦,这是本次最有复用价值的设计;
- 官方数据亮眼(+30 个百分点、Speak 假打断 -80%、Solace 删掉 23,000 行代码),但均为厂商口径,需要自测;
- 如果你已经有 LLM 与工具链,这一层值得直接试接;如果没有,先想清楚编排放在哪。
(本文配图来自 OpenAI 官方发布页,已下载至本站本地引用;架构与数字图表由本站据官方数据绘制。)