一句话总结
2026 年 9 月 24 日,Google 同一天放出两条线。企业侧:Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 正式可用——把近实时视频生成接到原生语音对话模型上,产出能唇形同步、保持表情的虚拟形象,中途切换 97 种语言不降画质、不产生视觉漂移,还支持异步工具调用(后台跑 API / CRM / ERP,对话不空转);全部音视频输出带 SynthID 水印。消费侧:Call for Me 开始向美国 Pixel 11 且订阅了 Gemini 的用户小范围测试,Gemini 可以替你打电话——问库存、订餐厅、改预约、把货先留着;用你自己的号码从你的手机拨出,实时转写让你全程旁听,任何时候都能接管。八年前 Google Duplex 在 I/O 上演示过替人订餐厅,今天它终于变成了功能;而同一天上线的 Live Avatar,则给了 Agent 一张脸。
数据来源:Google 官方博客《Introducing Gemini 3.8 Live with Live Avatar》(blog.google,2026-09-24)与 Google Cloud 官方博客《Gemini 3.8 Live with Live Avatar is now generally available》(cloud.google.com/blog,2026-09-24,作者 Fabien Blanc-paques,Group Product Manager, Gemini Live)、TechCrunch《Google tests letting Gemini call businesses for you》(Sarah Perez,2026-09-24 09:00 PDT)。文中配图来源已逐张标注。
同一天的两条线:一条给「脸」,一条给「行动权」
先看官方发布页说了什么:
![]()
Google 的表述很克制:「为我们的原生实时对话模型带来近实时的视觉存在感」。官方的能力清单是四项,我把它们整理成一张图:
![]()
拆开讲这四项:
① 视频头像与唇形同步。 对话中出现的是有同步唇形与自然表情的虚拟形象,可跑在网页、移动端、互动一体机上。企业可以从预设头像库里挑,也可以用一张参考图生成自定义头像——但目前自定义走白名单,不是自助开通。
② 原生语音到语音。 官方特别强调「不再需要老的语音转文字那一套」,用 Google ADK(Agent Development Kit)就能定义记忆并直接流式传音频;被打断之后能自然恢复对话,不丢掉会话上下文,也不丢后台正在跑的事务。
③ 异步工具调用。 这是最工程化的那一条:API、CRM、ERP 的调用可以放到后台执行,对话不必等、不出现「空转」。官方的例子是——你一边跟它闲聊,它一边把酒店入住登记办完。
④ 97 语言 + 实时视觉理解。 中途切换语言时,唇形与表情自适应,官方称不降画质、不产生「视觉漂移」(也就是让人一眼看出是 AI 视频的那种嘴型错位);同时它还能处理摄像头画面与屏幕共享,连同音频一起——「看得见用户所见的」。
Google Cloud 博客里的两张真实演示截图,比文字更能说明它落在什么场景:
![]()
左边是实时会话转写,右边是虚拟柜员本人。用户说「能帮我查一下余额吗」,它回答需要账号或出示卡片——这就是上一节说的「实时视觉理解」在做的事。
![]()
第二张更值得看:左边是理赔 Agent 与客户对话,左下角实时列出还缺哪些信息(姓名、保单号、联系方式、何时发生、何地发生、发生了什么),右边是它同步整理的笔记。这不是「能聊天的客服头像」,而是把表单填写这件苦差事塞进了对话里——异步工具调用 + 视觉理解的组合产物。
生态层面,Google 同步点名了 Live API 的集成伙伴:LiveKit、Pipecat、Fishjam、Agora、Vercel AI Gateway、LangChain、Vision Agents。这句话的分量在于——语音栈厂商可以直接出货 Gemini Live Agent,不用自己搭语音管线。换句话说,Live Avatar 不只是一次产品发布,它同时把「数字人客服」这类创业公司的核心工序,变成了模型运行时的一个开关。
另一条线:Call for Me 让 Gemini 拿起电话
同一天早上 9 点(太平洋时间),TechCrunch 报道了消费侧的进展:Call for Me 开始向美国 Pixel 11 且订阅了 Gemini 的用户推送,并且需要安装 Beta 版 Google Phone 应用——官方把它定位成实验。

关键能力点(以下均出自 TechCrunch 报道):
- 可以分享你批准的个人信息。这是它和上一代「只问不办」的功能之间的分水岭——能带信息,才能办事;
- 用你自己的手机号,直接从你的手机拨出——不是从 Google 的某个号码池打出去;
- 实时转写,你可以全程看着对话进行,任何时候接管;
- 能介绍自己、走自动语音菜单、排队等接通,然后跟真人把话说完;
- 官方举的任务例子:问某家店有没有货、订餐厅、把已排的日程改期、让店家先把商品留着。
Google 说这次故意只在小范围起步,理由是「真实世界的对话很微妙」。这句话背后是八年的积累:

2018 年 I/O 大会上,Google Duplex 演示替用户打电话订餐厅,还特意加上「um」「ah」让它听起来像人——当时的舆论焦点甚至不是技术,而是**「AI 该不该假装是人」**。此后这条线一直以「替你省事但不替你决定」的方式往前挪:Ask for Me 替你打电话问价格;Hold for Me / Talk to a Live Rep 替你排队等接通;Direct My Call 把自动语音菜单的按键直接显示出来。到 Call for Me,才第一次越过了「问」与「办」的分界线——它开始代表你,跟第三方做承诺了。
把两件事放在一起看:Agent 正在获得「存在感」和「代理权」
这两条线表面无关(一条卖给企业、一条给消费者),但拼起来是一个清晰的转向:
| Live Avatar(企业侧) | Call for Me(消费侧) | |
|---|---|---|
| 给 Agent 的东西 | 存在感:一张能对齐嘴型、能表达的脸 | 代理权:用你的号码、替你办事 |
| 关键机制 | 异步工具调用(后台办事,对话不停) | 分享已批准的个人信息(带信息才能办事) |
| 控制手段 | SynthID 水印、身份保护措施、自定义头像白名单 | 实时转写、随时接管、实验期小范围 |
| 竞争坐标 | HeyGen 一类的数字人创业公司被「卷进」模型运行时 | Meta Muse / Instinct 已经能打电话,Muse 两周下载 280 万、一度登顶美加免费榜 |
共同点:Agent 从「回答问题」变成了「代表你出现」。 过去两年我们评价 AI 的指标是「答得对不对」,而现在被摆到台面上的指标是「它替你出面的时候,第三方会不会以为那是你」——Live Avatar 用 97 语言的唇形同步回答前半个问题,Call for Me 用你的手机号和实时转写回答后半个问题。
Meta 这条对照线不能忽略。 TechCrunch 在开头就把竞争坐标点明了:Meta 的 Muse 与 Instinct 已经能替用户打电话;而在硬件侧,Meta 的 Charm 设备计划 12 月发货,Muse 两周拿下 280 万次下载、一度成为美加地区免费应用榜首。「谁能成为代理你生活的那个入口」已经是一场三家以上同时下注的仗,而 Google 打法是两条腿走路:企业侧卖能力(Live Avatar),消费侧抢习惯(Call for Me)。
风险:水印不是同意,转写不是授权
三点值得冷静看:
① SynthID 解决的是「可识别」,不是「可同意」。 官方明确所有 Live Avatar 输出都带 SynthID 水印,加上「尊重身份」的保护措施。但水印是事后识别手段,它不能替代事前告知:面对面通话里,对方看到的是一张会说话的脸,他并不知道自己在跟一个合成形象、以及一套在他背后运行的 CRM 打交道。客服场景尤其如此。
② 「分享你批准的个人信息」里的「批准」需要被设计得很细。 Call for Me 能办事的前提是能带信息出门,这是授权粒度的问题:是每次通话单独确认,还是可以预设一批?改预约会涉及日期与身份信息,订餐厅可能涉及手机号与姓名——粒度越粗,用户越不可能真正读一遍就点同意。 消费者侧最需要监督的通常不是模型能力,而是这个授予界面的设计。
③ 自定义头像走白名单,是对的方向,但也是有限保护。 用一张参考图生成头像,天然带着肖像权与品牌仿冒的风险;Google 用 allowlist 把它关在门外,企业侧可控。但请记住:预设头像同样会被用来做规模化客服,当一家公司用同一张脸接起十万通电话时,问题不再是「像不像人」,而是**「用户有没有可能知道自己在跟谁说话」**。
给开发者和团队的实用建议
如果你的业务里有「需要跟人反复确认信息」的环节(客服、预约、理赔、导览、陪练),这两条发布给你的是同一套设计原则:
- 把慢操作从对话路径里摘出去。 Live Avatar 的异步工具调用是明确的信号:任何需要 1 秒以上等待的后台动作,都不该让对话卡住。先用「我查一下」接住,再在后台跑,是这一代语音 Agent 的默认设计。
- 多语言不要再做「翻译 + TTS」两段式。 原生语音到语音 + 中途切语言不漂移,意味着「英语客户打断说中文」这类场景终于可以自然处理;如果你现在靠 ASR→翻译→TTS 拼管线,延迟与口型都会露馅。
- 把「授权粒度」当成产品功能而不是合规负担。 Call for Me 给了一个可抄的模式:你能带出门的信息必须逐项可勾选,而不是打包成一个「同意用户协议」。
- 给代理人身份留出披露位。 无论做客服头像还是代打电话,主动告知「我是 AI 助理」在未来不只是合规,也是信任设计——对方知道自己在跟谁说话,通话质量反而更高。
- 国内团队要留意的差距点。 这两条都不是靠单点模型能力取胜,而是模型 + 实时视频 + 电话系统 + 头显/手机硬件的组合。如果你的产品路线里没有把「能在真实通信链路上跑」当成目标,那这一代的体验差会从「回答质量」扩大到「能不能真的把事办成」。
小结
- Live Avatar 在 Gemini Enterprise 正式可用:真实时视频生成接原生语音对话,97 种语言唇形同步、中途切换不漂移,异步工具调用让后台办事不打断对话,输出带 SynthID 水印;预设头像可用,自定义头像走白名单;
- 官方两张演示截图说明它已经在做金融柜员核验身份和保险理赔信息收集这类「对话 + 表单」混合任务,生态侧 LiveKit / Pipecat / Agora / Vercel AI Gateway / LangChain 等可直接出货;
- Call for Me 向美国 Pixel 11 + Gemini 订阅用户小范围开放:可分享已批准的个人信息、用你的号码拨出、实时转写、随时接管,能问库存 / 订餐 / 改预约 / 留货;
- 时间线意义上,这是 Duplex(2018 演示)→ Ask for Me → Hold for Me → Call for Me 的第八年,也是第一次从「替你问」走到「替你办」;
- 一句话:Agent 这一代拿到的不是更强的脑子,而是脸、声音、电话号码和一张可以签字的授权书。
数据来源:Google 官方博客(2026-09-24)· Google Cloud 博客(2026-09-24)· TechCrunch(2026-09-24) 配图说明:官方发布页与 TechCrunch 截图为真实页面截图;两张演示图为 Google Cloud 官方博客原图(下载后本地引用);能力图与时间线图为本文自绘。 统计时间:2026-09-25