2026年9月15日,Google DeepMind 正式上线面向实时多模态与语音交互的新模型 Gemini 3.8 Live 以及主打深度并行推理的 Gemini 3.8 Live Extended Thinking。在官方给出的战报中,Extended Thinking 版本拿下了第三方评测机构 Artificial Analysis 语音对语音质量指数 82.6 分的榜首成绩,在 Agent 任务评测 τ-Voice 上取得 68.6% 完成率,并在单会话中支持 97 种语言即时切换。

与亮眼跑分同步到来的,还有表面上极具杀伤力的定价格局:其输入音频仅标价 3.00 美元 / 1M tokens(折合每分钟约 0.005 美元),输出音频为 12.00 美元 / 1M tokens。但如果穿透公关包装与跑分数字,从真实工程落地审视,这款底模基于 Gemini 3 Pro、知识库截止至 2025 年 1 月的模型,并没有给企业外呼和客服系统带来即插即用的低成本救赎;相反,它用严苛的会话生命周期与推倒重来的异步机制,向开发者抛出了全新的工程包袱。

边想边说的代价:强制非阻塞与状态机重构

在传统的语音交互范式中,模型必须等工具调用结束、数据返回后,再组织语言回答用户。Gemini 3.8 Live Extended Thinking 试图击碎这种卡顿感,让模型像真人一样在检索数据的同时发出“请稍等,我帮您查一下”的垫话,并实时口播任务进度。但这项能力的实现机制,是在 API 层面彻底废弃同步函数调用,强制推行纯异步的非阻塞状态机。

废弃同步调用后,异步状态机撕裂了线性业务的控制链路
废弃同步调用后,异步状态机撕裂了线性业务的控制链路

对于习惯了线性逻辑的开发者来说,这意味着整个通信链路的控制权被强行撕裂。在 Extended Thinking 的协议中,单次返回的标记 turnComplete: true 仅仅代表模型当前的这句语音已经播完,绝不意味着当前轮次的业务已经执行完毕。

Extended Thinking 异步生命周期流转 语音输入发起 触发后台工具调用 实时口播推进 turnComplete: true 后台函数执行 并发推理无停顿 真正任务终结 IDLE 状态判定 架构断层提醒:前端不能以声音停止作为闭环依据,必须基于全局交互轮询判定任务终止

前端业务层必须持续轮询模型的底层状态字段。只有当系统显式捕获到 interactionStatus 变为 IDLE,整套业务动作才算告一段落。如果在多轮长对话中出现网络微抖动、用户中途打断或异步函数超时,前端的状态机将陷入前所未有的回滚灾难。

  • 风险.把自然发音与工具执行解耦看似提升了流畅度,但把状态终结的裁决权扔给客户端,会直接击碎基于传统阻塞调用构建的呼叫中心业务架构。

账面低价与长连接计费黑洞

价格是 Google 在本次发布中最为推崇的武器。相比 OpenAI GPT-Realtime-2 高达 32 美元的输入与 64 美元的输出音频单价,Gemini 3.8 Live 的表观计费几乎是对手的十分之一;而对于思考 Tokens,Google 也仅按常规文本的 4.50 美元 / 1M 收取,并未因并行推理收取溢价。

长连接下历史上下文反复重算,静默挂机也会沦为扣费陷阱
长连接下历史上下文反复重算,静默挂机也会沦为扣费陷阱
平台与模型方案音频输入计价音频输出计价典型计费结算模式
Gemini 3.8 Live$3.00 / 1M tokens$12.00 / 1M tokensWebSocket 历史上下文逐轮重新计算
OpenAI GPT-Realtime-2$32.00 / 1M tokens$64.00 / 1M tokensToken 梯队计价与单轮独立结算
ElevenLabs Agent包含在时长套餐内超限 $0.16 / 分钟纯通话时长计费(基准 $0.08 / 分钟)

但这种静态比价掩盖了 WebSocket 长连接环境下的真实计费逻辑。在原生端到端架构中,模型为了保持上下文连贯,每一轮新发起的语音交互,都需要把通道内累积的音频与上下文 Tokens 重新计算一遍。伴随对话轮次增加,每一秒通话的综合边际成本呈几何级数攀升。

根据早期接入开发者的实测反馈,在 WebSocket 通道开启后,即便用户保持静默挂机,未显式关闭长连接的会话曾产生高达每分钟约 0.1167 美元的持续消耗。这远高于 ElevenLabs 等编排型平台按固定通话时长(每分钟 0.08 美元)计费的支出水平。

纸面上廉价的音频单价,在长连接多轮重算机制面前很容易变成失控的账单陷阱。

落地断层:15分钟上限与真实落地边界

除了隐藏的账本逻辑,Gemini 3.8 Live 面临的另一大瓶颈在于物理时长限制。官方技术文档明确标示:其纯音频单次会话的硬性上限仅为 15 分钟,而一旦开启音视频混合输入,单次会话上限更骤降至 2 分钟

面对严格的会话时长上限,开发者必须自建缓冲层维系通话
面对严格的会话时长上限,开发者必须自建缓冲层维系通话
原生模型会话时长红线与实际业务落差 纯音频单次连接硬上限 15 分钟 迫使企业自建滑动窗口与跨会话状态缓存 音视频混合交互硬上限 2 分钟 仅适合即时排障,难以承载连续工业巡检

尽管底模标称具备 131,072 tokens(约 128K)的输入窗口与 65,536 tokens(约 64K)的输出能力,但在实时流式传输下,高频音频帧的吞吐压力让系统无法支撑长时间的连接状态。对企业来说,一通复杂的政企客服或金融外呼极易超过 15 分钟,开发者必须自行搭建上下文滑动窗口与状态压缩方案,在断连瞬间无感切入新会话。

与此同时,官方宣传的 82.6 分高分,也属于发布节点特定环境下的专项测试。截至 2026 年 9 月中旬,在第三方独立公开榜单中,GPT-Realtime-2 High(77.2 分)与 Grok Voice Think Fast 1.0(75.7 分)依然稳占常态排位前端,机构尚未将 3.8 Live 正式归入日常追踪队列。

而在呼叫中心最依赖的 SIP 协议集成、特定方言语调的抗噪表现以及破音容错上,以 ElevenLabs 为代表的工程化语音平台依然牢牢把控着落地体验。Gemini 3.8 Live 的多模态整合能力毫无疑问展示了端到端语音大模型的技术上限,但若想从演示原型走向工业化外呼流水线,开发者还需要自备足够的缓冲层,去填补从 API 到现实业务场景之间的鸿沟。

  • 建议.对长流程外呼或强连续性业务,现阶段应将该模型定位于短平快的高敏排障场景,切忌直接替换成熟的传统固话排队系统。