2026年9月15日,Google DeepMind 正式上线面向实时多模态与语音交互的新模型 Gemini 3.8 Live 以及主打深度并行推理的 Gemini 3.8 Live Extended Thinking。在官方给出的战报中,Extended Thinking 版本拿下了第三方评测机构 Artificial Analysis 语音对语音质量指数 82.6 分的榜首成绩,在 Agent 任务评测 τ-Voice 上取得 68.6% 完成率,并在单会话中支持 97 种语言即时切换。
与亮眼跑分同步到来的,还有表面上极具杀伤力的定价格局:其输入音频仅标价 3.00 美元 / 1M tokens(折合每分钟约 0.005 美元),输出音频为 12.00 美元 / 1M tokens。但如果穿透公关包装与跑分数字,从真实工程落地审视,这款底模基于 Gemini 3 Pro、知识库截止至 2025 年 1 月的模型,并没有给企业外呼和客服系统带来即插即用的低成本救赎;相反,它用严苛的会话生命周期与推倒重来的异步机制,向开发者抛出了全新的工程包袱。
边想边说的代价:强制非阻塞与状态机重构
在传统的语音交互范式中,模型必须等工具调用结束、数据返回后,再组织语言回答用户。Gemini 3.8 Live Extended Thinking 试图击碎这种卡顿感,让模型像真人一样在检索数据的同时发出“请稍等,我帮您查一下”的垫话,并实时口播任务进度。但这项能力的实现机制,是在 API 层面彻底废弃同步函数调用,强制推行纯异步的非阻塞状态机。

对于习惯了线性逻辑的开发者来说,这意味着整个通信链路的控制权被强行撕裂。在 Extended Thinking 的协议中,单次返回的标记 turnComplete: true 仅仅代表模型当前的这句语音已经播完,绝不意味着当前轮次的业务已经执行完毕。
前端业务层必须持续轮询模型的底层状态字段。只有当系统显式捕获到 interactionStatus 变为 IDLE,整套业务动作才算告一段落。如果在多轮长对话中出现网络微抖动、用户中途打断或异步函数超时,前端的状态机将陷入前所未有的回滚灾难。
- 风险.把自然发音与工具执行解耦看似提升了流畅度,但把状态终结的裁决权扔给客户端,会直接击碎基于传统阻塞调用构建的呼叫中心业务架构。
账面低价与长连接计费黑洞
价格是 Google 在本次发布中最为推崇的武器。相比 OpenAI GPT-Realtime-2 高达 32 美元的输入与 64 美元的输出音频单价,Gemini 3.8 Live 的表观计费几乎是对手的十分之一;而对于思考 Tokens,Google 也仅按常规文本的 4.50 美元 / 1M 收取,并未因并行推理收取溢价。

| 平台与模型方案 | 音频输入计价 | 音频输出计价 | 典型计费结算模式 |
|---|---|---|---|
| Gemini 3.8 Live | $3.00 / 1M tokens | $12.00 / 1M tokens | WebSocket 历史上下文逐轮重新计算 |
| OpenAI GPT-Realtime-2 | $32.00 / 1M tokens | $64.00 / 1M tokens | Token 梯队计价与单轮独立结算 |
| ElevenLabs Agent | 包含在时长套餐内 | 超限 $0.16 / 分钟 | 纯通话时长计费(基准 $0.08 / 分钟) |
但这种静态比价掩盖了 WebSocket 长连接环境下的真实计费逻辑。在原生端到端架构中,模型为了保持上下文连贯,每一轮新发起的语音交互,都需要把通道内累积的音频与上下文 Tokens 重新计算一遍。伴随对话轮次增加,每一秒通话的综合边际成本呈几何级数攀升。
根据早期接入开发者的实测反馈,在 WebSocket 通道开启后,即便用户保持静默挂机,未显式关闭长连接的会话曾产生高达每分钟约 0.1167 美元的持续消耗。这远高于 ElevenLabs 等编排型平台按固定通话时长(每分钟 0.08 美元)计费的支出水平。
纸面上廉价的音频单价,在长连接多轮重算机制面前很容易变成失控的账单陷阱。
落地断层:15分钟上限与真实落地边界
除了隐藏的账本逻辑,Gemini 3.8 Live 面临的另一大瓶颈在于物理时长限制。官方技术文档明确标示:其纯音频单次会话的硬性上限仅为 15 分钟,而一旦开启音视频混合输入,单次会话上限更骤降至 2 分钟。

尽管底模标称具备 131,072 tokens(约 128K)的输入窗口与 65,536 tokens(约 64K)的输出能力,但在实时流式传输下,高频音频帧的吞吐压力让系统无法支撑长时间的连接状态。对企业来说,一通复杂的政企客服或金融外呼极易超过 15 分钟,开发者必须自行搭建上下文滑动窗口与状态压缩方案,在断连瞬间无感切入新会话。
与此同时,官方宣传的 82.6 分高分,也属于发布节点特定环境下的专项测试。截至 2026 年 9 月中旬,在第三方独立公开榜单中,GPT-Realtime-2 High(77.2 分)与 Grok Voice Think Fast 1.0(75.7 分)依然稳占常态排位前端,机构尚未将 3.8 Live 正式归入日常追踪队列。
而在呼叫中心最依赖的 SIP 协议集成、特定方言语调的抗噪表现以及破音容错上,以 ElevenLabs 为代表的工程化语音平台依然牢牢把控着落地体验。Gemini 3.8 Live 的多模态整合能力毫无疑问展示了端到端语音大模型的技术上限,但若想从演示原型走向工业化外呼流水线,开发者还需要自备足够的缓冲层,去填补从 API 到现实业务场景之间的鸿沟。
- 建议.对长流程外呼或强连续性业务,现阶段应将该模型定位于短平快的高敏排障场景,切忌直接替换成熟的传统固话排队系统。
