谷歌于2026年9月15日正式发布原生端到端实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。这也是语音大模型赛道上,第一次有厂商把深度推理与全双工对话硬生生缝进同一个实时系统。

过去两年,语音交互要么追求极限响应速度而沦为浅层反射,要么为了深度推理让扬声器陷入尴尬的死寂。谷歌这次交出的核心解法,是用一边说话、一边后台推理的并行机制,试图化解思考深度与对话延迟的天然互斥。这标志着端到端语音大模型的竞争考卷彻底改写:行业不再满足于拟真声线和低延迟的皮囊,而是转向考察模型在真实系统里能不能把事情办对。

双工推理机制打破静默死结

在传统技术链路中,实时语音助手长期依赖语音转文本、大语言模型生成、文本转语音的三段式架构。这种拼接方案不仅带来数秒的感知延迟,更无法保留语气情绪,面对打断与插话更是疲态尽显。随之而来的原生端到端语音模型解决了语气感知,却一头撞上了新墙:面对复杂的多步工具调用,模型一旦展开推理,就必须长时间闭嘴,对话节奏随即崩塌。

语音模型在后台深度推理时依靠过渡垫词维持通话不中断
语音模型在后台深度推理时依靠过渡垫词维持通话不中断

Gemini 3.8 Live Extended Thinking 改变了这一交互协议。它在架构上对外暴露了 interaction_status 生命周期状态,并要求异步非阻塞工具调用。当后台进行多步检索或运算时,模型会自然抛出过渡垫词维持交流,甚至向用户口头同步后台进度,让客户端能够明确区分模型是仍在后台推理还是任务已完成。

语音交互架构演进路径 传统三段拼接 STT + LLM + TTS 数秒级机械延迟 情绪丢失 / 抢话生硬 初级端到端模型 原生语音输入输出 毫秒级浅层反射 深度推理即陷入静默 双工并行推理 口头垫词 + 异步调用 边说话边执行工具 解决冷场与推理冲突

在支持基础对话的常规版本 3.8 Live 上,系统支持一次对话中跨 97 种语言 自动检测与无缝切换,并开放了高达 131K tokens 的输入上下文窗口,支持近实时视觉对齐。但开发者需要意识到,这种并行机制本质上把交互状态机的复杂度转嫁给了客户端,如果外部系统未能及时捕获 interaction_status,依然会出现请求超时与调度卡顿。

跑分榜首背后的行动力落差

伴随架构演进,评测基准也从考辨音色,变成了考查真实系统里的行动力。

模型在银行多步工作流中近三分之二概率无法完成数据库写入
模型在银行多步工作流中近三分之二概率无法完成数据库写入

在 Artificial Analysis 发布的 Speech-to-Speech Index v2.0 评测中,Gemini 3.8 Live Extended Thinking 拿到 82.6 分 位列综合第一。其中包含 Big Bench Audio 97.7%、τ-Voice 68.6%、Speech Agent Arena Elo 990 分与任务成功率 89.1%,Full Duplex Bench 轮流与打断得分为 91.9%。谷歌在官方宣传中称其在企业级工作流基准 ServiceNow EVA-Bench 上推向了帕累托前沿。

关键测试基准表现 82.6 Speech-to-Speech 榜首 68.6% τ-Voice 任务完成率 35.1% Sierra 银行业务基准 pass@1
高分掩盖不了行动力鸿沟,语音智能体正迎来最严苛的真实数据库校验。

然而亮眼总分下隐藏着明显的业务断层。反映真实银行多步工具工作流的 Sierra τ³-Banking 基准上,该模型的 pass@1 得分仅有 35.1%。这意味着在严肃金融与企业流程中,模型面对涉及数据库状态变更的复杂操作,有将近三分之二的概率无法一次性准确执行完毕。

官方 Model Card 也明确标注,其底层知识库截止时间为 2025 年 1 月,并将幻觉、偶发性响应迟缓和超时列为已知局限,强调时效性任务必须依赖外部工具接地。此外,虽然宣传中声称 EVA-Bench 逼近帕累托前沿,但官方并未对外发布确切的表格化坐标分值,研究人员尚无法直接验证其在 213 个企业场景下的离散鲁棒性。

定价重构下的生态权衡与虚假确认风险

除了模型机制,谷歌公布的 API 定价策略直接把矛头指向了原有技术方案的成本护城河。

极低调用成本与电话网络毫秒级首字延迟之间的工程权衡
极低调用成本与电话网络毫秒级首字延迟之间的工程权衡
输入输出模态官方标准定价 (每百万 Token)换算实际调用成本 (估算)
文本输入0.75 美元适合混合提示词注入
音频输入3.00 美元约每分钟 0.005 美元
图像与视频输入1.00 美元约每分钟 0.002 美元
文本输出 (含 Thinking)4.50 美元覆盖后台深度推理解析
音频输出12.00 美元约每分钟 0.018 美元

每分钟约 0.018 美元的音频输出与 0.005 美元的音频输入,将端到端语音的试错门槛降到了极低区间。这给 LiveKit、Agora、Pipecat 等中间件平台带来了新集成流量,也逼迫传统三段式语音方案加快退场步伐。

但在真实的落地选型中,企业开发者仍面临明确的权衡。OpenAI Realtime 拥有成熟的 WebRTC、WebSocket 以及 SIP 电话系统直连生态,在传统客服外呼系统改造中依然占据工程先发优势。相比之下,Gemini 3.8 Live 的核心优势在于原生视听多模态支持、超大上下文和相对低廉的 Token 定价,但独立实测数据显示,上一代 Gemini 3.1 Flash Live 在电话环境下的首字发声延迟中位数仍在 786.4 毫秒 左右,3.8 Live 在真实生产环境下的端到端延迟跑分依然有待各方检验。

  • 风险.纯语音交互最危险的不是知识性错误,而是模型口头给出已完成办理,底层数据库却未成功执行的虚假动作确认。

在缺乏图形界面的场景下,这种虚假确认将直接演变为纠纷甚至资损。即使谷歌全量启用了 SynthID 音频水印来防范合成风险,面对自动化率仅三成多的严肃复杂流程,企业在引入端到端模型时,首要任务仍是建立严格的人机协作降级与后端防虚假确认兜底机制。