谷歌于2026年9月15日正式发布原生端到端实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。这也是语音大模型赛道上,第一次有厂商把深度推理与全双工对话硬生生缝进同一个实时系统。
过去两年,语音交互要么追求极限响应速度而沦为浅层反射,要么为了深度推理让扬声器陷入尴尬的死寂。谷歌这次交出的核心解法,是用一边说话、一边后台推理的并行机制,试图化解思考深度与对话延迟的天然互斥。这标志着端到端语音大模型的竞争考卷彻底改写:行业不再满足于拟真声线和低延迟的皮囊,而是转向考察模型在真实系统里能不能把事情办对。
双工推理机制打破静默死结
在传统技术链路中,实时语音助手长期依赖语音转文本、大语言模型生成、文本转语音的三段式架构。这种拼接方案不仅带来数秒的感知延迟,更无法保留语气情绪,面对打断与插话更是疲态尽显。随之而来的原生端到端语音模型解决了语气感知,却一头撞上了新墙:面对复杂的多步工具调用,模型一旦展开推理,就必须长时间闭嘴,对话节奏随即崩塌。

Gemini 3.8 Live Extended Thinking 改变了这一交互协议。它在架构上对外暴露了 interaction_status 生命周期状态,并要求异步非阻塞工具调用。当后台进行多步检索或运算时,模型会自然抛出过渡垫词维持交流,甚至向用户口头同步后台进度,让客户端能够明确区分模型是仍在后台推理还是任务已完成。
在支持基础对话的常规版本 3.8 Live 上,系统支持一次对话中跨 97 种语言 自动检测与无缝切换,并开放了高达 131K tokens 的输入上下文窗口,支持近实时视觉对齐。但开发者需要意识到,这种并行机制本质上把交互状态机的复杂度转嫁给了客户端,如果外部系统未能及时捕获 interaction_status,依然会出现请求超时与调度卡顿。
跑分榜首背后的行动力落差
伴随架构演进,评测基准也从考辨音色,变成了考查真实系统里的行动力。

在 Artificial Analysis 发布的 Speech-to-Speech Index v2.0 评测中,Gemini 3.8 Live Extended Thinking 拿到 82.6 分 位列综合第一。其中包含 Big Bench Audio 97.7%、τ-Voice 68.6%、Speech Agent Arena Elo 990 分与任务成功率 89.1%,Full Duplex Bench 轮流与打断得分为 91.9%。谷歌在官方宣传中称其在企业级工作流基准 ServiceNow EVA-Bench 上推向了帕累托前沿。
高分掩盖不了行动力鸿沟,语音智能体正迎来最严苛的真实数据库校验。
然而亮眼总分下隐藏着明显的业务断层。反映真实银行多步工具工作流的 Sierra τ³-Banking 基准上,该模型的 pass@1 得分仅有 35.1%。这意味着在严肃金融与企业流程中,模型面对涉及数据库状态变更的复杂操作,有将近三分之二的概率无法一次性准确执行完毕。
官方 Model Card 也明确标注,其底层知识库截止时间为 2025 年 1 月,并将幻觉、偶发性响应迟缓和超时列为已知局限,强调时效性任务必须依赖外部工具接地。此外,虽然宣传中声称 EVA-Bench 逼近帕累托前沿,但官方并未对外发布确切的表格化坐标分值,研究人员尚无法直接验证其在 213 个企业场景下的离散鲁棒性。
定价重构下的生态权衡与虚假确认风险
除了模型机制,谷歌公布的 API 定价策略直接把矛头指向了原有技术方案的成本护城河。

| 输入输出模态 | 官方标准定价 (每百万 Token) | 换算实际调用成本 (估算) |
|---|---|---|
| 文本输入 | 0.75 美元 | 适合混合提示词注入 |
| 音频输入 | 3.00 美元 | 约每分钟 0.005 美元 |
| 图像与视频输入 | 1.00 美元 | 约每分钟 0.002 美元 |
| 文本输出 (含 Thinking) | 4.50 美元 | 覆盖后台深度推理解析 |
| 音频输出 | 12.00 美元 | 约每分钟 0.018 美元 |
每分钟约 0.018 美元的音频输出与 0.005 美元的音频输入,将端到端语音的试错门槛降到了极低区间。这给 LiveKit、Agora、Pipecat 等中间件平台带来了新集成流量,也逼迫传统三段式语音方案加快退场步伐。
但在真实的落地选型中,企业开发者仍面临明确的权衡。OpenAI Realtime 拥有成熟的 WebRTC、WebSocket 以及 SIP 电话系统直连生态,在传统客服外呼系统改造中依然占据工程先发优势。相比之下,Gemini 3.8 Live 的核心优势在于原生视听多模态支持、超大上下文和相对低廉的 Token 定价,但独立实测数据显示,上一代 Gemini 3.1 Flash Live 在电话环境下的首字发声延迟中位数仍在 786.4 毫秒 左右,3.8 Live 在真实生产环境下的端到端延迟跑分依然有待各方检验。
- 风险.纯语音交互最危险的不是知识性错误,而是模型口头给出已完成办理,底层数据库却未成功执行的虚假动作确认。
在缺乏图形界面的场景下,这种虚假确认将直接演变为纠纷甚至资损。即使谷歌全量启用了 SynthID 音频水印来防范合成风险,面对自动化率仅三成多的严肃复杂流程,企业在引入端到端模型时,首要任务仍是建立严格的人机协作降级与后端防虚假确认兜底机制。
