展开目录
#OpenAI#GPT-Live-1#语音Agent#全双工#API#实时语音#开发者

OpenAI 把 GPT-Live-1 放进 API:0.05 美元/分钟的语音层,把三级级联砍成一个模型

9 月 10 日,OpenAI 在 API 上线 GPT-Live-1 全双工语音模型:边听边说、能被打断、支持电话场景,前端语音层 0.05 美元/分钟且按秒计费,复杂推理与工具调用委派给 GPT-6 Astra 等后端模型。Full Duplex Bench 比 GPT-Realtime-2.1 高 30 个百分点,Speak 称假打断减少约 80%,Solace Health 删掉了 23,000 行级联代码。

预计阅读 9 分钟

一句话总结

2026 年 9 月 10 日,OpenAI 把 GPT-Live-1 从 ChatGPT 搬进了 API:一个全双工(full-duplex)语音模型,能一边听一边说,会等你说完、会接「嗯」「对」这样的回填词、也能在你打断它的时候立刻改口。前端语音层定价 0.05 美元/分钟、按秒计费,复杂推理和工具调用则委派给后端模型(如 GPT-6 Astra)。官方称其 Full Duplex Bench 比 GPT-Realtime-2.1 高出 30 个百分点——语音 Agent 的三段式架构,被压缩成了「一个对话层 + 任意后端」两层。

数据来源

本文事实依据来自:

  • OpenAI 官方发布《Build more natural voice experiences with GPT-Live-1 in the API》(2026-09-10)
  • OpenAI 官方产品页《Introducing GPT-Live》(2026-07-08)
  • OpenAI 开发者文档 developers.openai.com/api/docs/guides/live
  • OpenAI 开发者社区公告(2026-09-10)
  • 客户案例口径:Yelp、Speak、Fin(Intercom)、Cognition、Solace Health 官方引述

OpenAI 官方 GPT-Live-1 发布主视觉

图片来源:OpenAI 官方发布页


级联架构的问题,不在模型而在「接力」

上一代语音 Agent 的标准做法是拼装:语音转文字(STT)→ 语言模型推理(LLM)→ 文字转语音(TTS)。听起来合理,做起来每一步都在丢东西:

  • 每次交接都有延迟,用户能明显感到「顿一下」;
  • 判断「用户说完了吗」变成了一个独立工程问题,做不好就是抢话或者冷场;
  • 用户中途打断、改口、停顿思考,三个模型谁负责处理?最后都落到了业务代码里。

GPT-Live-1 的解法是把这一层合起来:用一个模型同时推理输入音频和输出音频。官方在发布页里把三个模型的意图能力全部拿掉,只留一段话:「GPT-Live-1 处理听和说,把更深的推理委派给后端。」

一个数字最能说明这件事的分量:医疗语音平台 Solace Health 的联合创始人兼 CTO Tony Stoyanov 在官方引述里说,相比他们原本的级联方案,GPT-Live-1 让代码库简化了 80%、删掉了 23,000 行代码

传统级联架构 vs GPT-Live-1 全双工架构对比


六个新能力,逐个看

官方在发布页里列了这次 API 版的六个重点:

  1. 打断处理:单模型同时推理输入与输出音频,绕开了链式架构的延迟与脆弱交接;
  2. 推理与工具调用委派:可以把手上的难题丢给后端文本模型(如 GPT-6 Astra 或第三方模型);
  3. 语气、语速与风格:通过 system prompt 就能调——这对做品牌语音的团队是刚需;
  4. 静默上下文管理与背景噪音:不打断对话、也不把每一步都「念」出来;
  5. 长会话可靠性:改善长时间交互中的上下文保持与对话质量;
  6. 电话支持(telephony):可以直接部署到电话场景,从订餐订座到客服。

此外还有几个对工程实现很实用的点:GPT-Live-1 原生输出 ASR 转写文本与回复文本,对字母数字的理解更强,支持关键词偏置(keyword biasing)——也就是说「订单号 A7F3-Q9」「邮编 200040」这类内容不需要你自己做后处理纠正。它虽然不是轮次式模型,但原生支持 turn detection,想继续按轮次构建的老代码可以平滑迁移。


「前台负责聊,后台负责想」

这次 API 版最值得琢磨的设计是委派(delegation):语音层不负责「想」,只负责「聊」。

开发者可以按任务性质挑后端——比如用轻量模型处理排期、订单更新这类高频任务,用 Astra 这类强推理模型处理复杂客服问题,再用 Codex 之类的 agent harness 去查仓库、跑代码。官方给出的示例里,对话上下文会通过 delegation_id 传给 Codex,结果以事件形式回填进对话:

import { Codex } from "@openai/codex-sdk";

const thread = new Codex().startThread({
  workingDirectory: "./repo",
  sandboxMode: "read-only",
  approvalPolicy: "never",
});

async function answer(live, delegationId, context) {
  const { finalResponse } = await thread.run(
    `Answer the latest question using this repo.
     Reply in two short spoken sentences.\n${context}`
  );
  // 把后台结果回填进正在进行的语音会话
  live.send({
    type: "session.commentary.append",
    delegation_id: delegationId,
    content: finalResponse,
  });
}

代码摘自 OpenAI 官方发布页的示例片段(连接建立与委派处理细节已省略)。

这个结构的含义是:语音延迟和后端推理深度被解耦了。用户不会因为后端在跑一段 30 秒的推理而听到长久的沉默——对话继续,结果准备好了再插进来。对企业架构师来说,这也意味着一件事:语音不再是「买一个端到端黑盒」,而是可以复用现有模型与工具链的一层

GPT-Live-1 的委派结构:语音层 + 后端模型 / 工具 / Agent harness


评测:比 GPT-Realtime-2.1 高 30 个百分点

官方给出的几组关键数据:

  • Full Duplex Bench:比 GPT-Realtime-2.1 高 30 个百分点,主要提升在轮次切换延迟与交互行为上(覆盖航空、零售、电信三个域的语音客服任务,按 Pass@1 计分、各域等权);
  • Tau3(语音 Agent 端到端任务):配 GPT-6 Astra 中档推理强度时排名第 1
  • 另有银行知识检索类评测(97 个任务)、停顿处理、背景人声干扰、轮次切换延迟、口语化工具调用等分项。

客户案例里最直观的是语言学习平台 Speak:他们发现 GPT-Live-1 给了学习者更多思考时间,假打断(interruption)比原来的轮次式系统减少了近 80%。Yelp 的 CTO 则提到,GPT-Live-1 用在 Yelp Host 的订座与点单电话上后,电话处理率有「可观的提升」,而且来电者开始说更完整、更自然的句子——这个细节挺有意思:它说明体验的改善不只体现在机器侧,用户自己也会被「带着」说得更自然。

GPT-Live-1 的关键数字:0.05 美元/分钟、+30 个百分点、-80% 假打断、23,000 行代码


价格与接入

  • 语音层0.05 美元/分钟,按秒计费
  • 后端模型与工具调用:单独计费(你选什么模型,就按什么模型的价算);
  • 声音:从少数几个实时音色扩展为跨口音、方言、语言的更多选择;自定义声音需要联系销售确认资格与流程;
  • 企业方案:官方同时提到 OpenAI Presence,面向企业部署可回答问题、使用公司系统、按授权执行动作并转人工的语音 Agent。

按这个价格折算:一通 3 分钟的客服电话,语音层成本约 0.15 美元;如果后端用轻量模型处理,整体大概落在几美分到一美元之间的区间(取决于上下文长度与工具调用次数)。相比自建 STT+LLM+TTS 三段链路,省掉的不只是钱,更是那 23,000 行胶水代码的维护成本

GPT-Live-1 官方演示截图:Yelp Host 在背景噪音与插话中完成订座

图片来源:OpenAI 官方发布页(Yelp 演示片段)


和现有语音工具栈怎么选

如果你已经在用第三方语音 Agent 平台,判断标准其实很简单:你要的是「一个能聊的前台」,还是「一整套包含编排、监控、合规的成品」?

方案定位适合谁
GPT-Live-1 + 自选后端只提供全双工对话层,编排、工具、后端模型全部自选有工程能力、想复用现有 LLM/工具链的团队
Vapi / Retell 等语音 Agent 平台端到端编排 + 号码 + 监控面板想快速上线电话客服、少写代码的团队
ElevenLabs / Cartesia / MiniMax 等 TTS只解决「说得好听」已有 ASR 与 LLM、只缺音色的场景

GPT-Live-1 的定位更接近第一类:它替代的是「STT + 打断判定 + TTS」这一层,而不是整个 Agent 平台。如果你的业务里已经有一堆工具和模型在跑,这一层能直接插进去;如果你连编排都还没有,仍然需要上面再加一层。


注意事项

  • 延迟预算要重新算:语音层再快,后端推理仍会占用时间。委派机制解决的是「不说话就尴尬」,不是「结果变快」。
  • 电话场景的合规是硬约束:录音告知、号码资质、地区法规都会落到你自己头上,OpenAI 只提供技术能力。
  • 成本与上下文长度强相关:委派给大模型做长推理时,后端账单可能远超每分钟 0.05 美元,上线前务必用真实话术压测。
  • 评测口径同样是厂商自跑:+30 个百分点、第 1 名都来自 OpenAI 自己的评测,Speak 的 -80% 也是「早期评测」口径。做决策前,请用你自己的场景跑一轮。
  • 自定义音色需要申请:不是开箱即用,别把它排进没有 buffer 的排期里。

总结

  • GPT-Live-1 进 API 的意义,是把语音 Agent 从三段式级联压成一个对话层
  • 定价 0.05 美元/分钟(按秒计费),真正的成本变量转移到你选的后端模型;
  • 委派机制让「听说的延迟」和「推理的深度」解耦,这是本次最有复用价值的设计;
  • 官方数据亮眼(+30 个百分点、Speak 假打断 -80%、Solace 删掉 23,000 行代码),但均为厂商口径,需要自测;
  • 如果你已经有 LLM 与工具链,这一层值得直接试接;如果没有,先想清楚编排放在哪。

(本文配图来自 OpenAI 官方发布页,已下载至本站本地引用;架构与数字图表由本站据官方数据绘制。)

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。