一个只有百来行代码、没有任何第三方打包依赖的纯 HTML 文件,接上浏览器原生的 Web Audio API 和 WebSocket,就能让用户对着屏幕开口说话,还能随时出声打断模型的回答。开发者 Simon Willison 借助 GPT-6 Astra Extra High 查阅开发文档写出的这个极简界面,让不少人觉得端到端语音交互的技术门槛已经彻底消失。
但这种直觉往往来自演示的幸存者偏差。2026 年 9 月 15 日,Google 正式推出基于 Gemini 3 Pro 架构的 gemini-3.8-live 与 gemini-3.8-live-extended-thinking。这一步让原生双向语音从实验性管道推向正式生产环境,也直接把战火引向了 OpenAI 的全双工语音模型 gpt-live-1。
掩盖延迟的话术与双生架构
传统语音系统的积木搭建法并不复杂:语音转文字(STT)、模型推理、文字转语音(TTS)串联排开。这种管道式级联虽然稳定,但数秒的端到端等待和丢失的语音语调,几乎抹杀了所有像真人的对话感。
Gemini 3.8 选择直接走原生音频输入输出,音频协议支持 16 kHz 原始 PCM 输入与 24 kHz PCM 输出,要求客户端按 20 至 40 毫秒分块流式收发,并在 97 种语言之间自动识别切换。音频输出中还永久内嵌了 DeepMind SynthID 水印。
为了解决深层推理带来的停顿尴尬,Extended Thinking 引入了后台思考分级和非阻塞异步工具调用。当模型需要调用外部系统或组织复杂长句时,它不会陷入长时间死寂,而是主动插入“正在查看”这类语气填充词。Google 公布的成绩单相当抢眼,Artificial Analysis 语音质量指数拿下 82.6 分,Big Bench Audio 达到 97.7%。
但官方始终避开了一个核心指标:端到端首音延迟(TTFA)。在早期的 Full-Duplex-Bench-v3 测试中,Gemini 3.1 Live 在特定工具调用场景实测延迟高达 4.25 秒。即便换成了 3.8 架构,在真实网络抖动和深层计算介入时,这种口头填充更像是精心设计的缓冲垫,而非彻底消除了物理推理耗时。
计费账单里的算术游戏
两家厂商在全双工语音上的计费哲学完全不同。
OpenAI 针对 gpt-live-1 采取了一刀切的包时费:每分钟固定收取 $0.05,把音频传输、打断检测和连接损耗打包在内。
Google 则把 Gemini 3.8 拆回了细粒度的 Token 结算:音频输入每百万 Token 收取 $3.00(约合每分钟 $0.005),音频输出每百万 Token 收取 $12.00(约合每分钟 $0.018)。加上文本输入 $0.75 和含思考过程的文本输出 $4.50,官方算出的双向对话基准成本只要 $0.023 / 分钟,看起来便宜了一大半。
天上不会凭空掉馅饼。这笔每分钟 $0.023 的账单,只在对话刚刚开始、毫无上下文包袱的前两分钟成立。
Gemini 3.8 的上下文上限虽然支持到 131,072 个 Token(单次最大输出 65,536 个 Token),但它目前不支持 Prompt Caching。在 WebSocket 长连接中,每一轮客户端与服务端的来回交互,都在按全量历史上下文和转录文本重复扣费。
- 风险.若未自研压缩算法,官方文档标明纯音频会话在 15 分钟左右就会耗尽上下文额度;一旦开启音频加视频的双流多模态,会话仅能维持约 2 分钟。
如果企业按每分钟两分钱的预算上线客服业务,却放任用户进行多轮长谈,月底收到的账单很容易击穿预期。
优雅演示背后的工程暗礁
Simon Willison 的极简代码能在浏览器里流畅跑通,核心原因是开发机上插着耳机。一旦把同一套逻辑搬进日常免提设备或电话线路,工程脆弱点就会暴露无遗。
纸上得来终觉浅,绝知此事要躬行。
OpenAI 在 gpt-live-1 上强调原生全双工边听边说,在第三方 Speak 测试中宣称思考停顿时的打断误判率降低了近 80%。而 Gemini 3.8 的实时打断,在底层仍然依赖客户端 VAD(语音活动检测)与服务端的 serverContent.interrupted 事件协同。
在社区开发者的集中反馈中,Gemini 3.8 缺乏服务端回声消除(AEC)。扬声器播出的声音只要被麦克风重新收录,就会直接触发模型的自我打断机制;要是客户端音频缓冲区清空逻辑出现毫秒级偏差,还会引发 WebSocket 持续连接但模型不再出声的假死状态。
雪上加霜的是,高风控企业所依赖的 Structured Outputs 和原生代码执行,在目前的 3.8 实时流接口里均未开放。
- 建议.当下的 Gemini 3.8 适合作为具有多模态输入需求的极客工具或短平快咨询助手;但如果目标是承接电信级 SIP 外呼系统,架构师必须在边缘网关自建回声抑制与超时看门狗,否则很容易演变为生产事故。
Google 押注的是全模态的广度,把文本、音频、图像和视频全塞进同一个通道;而 OpenAI 押注的是单一听觉通道的打磨。对于开发者来说,辨清这层包装,比为百行代码的简易演示喝彩重要得多。
