Google在8月26日发布了新一代语音转文字模型Gemini 3.5 Transcribe,官方给出的数字很漂亮:非流式场景词错率2.6%,比前代Chirp 3提速70%,还能自动去掉“嗯”“啊”这些语气词,把口语直接整理成干净文本。第三方基准Artificial Analysis也确认了这个成绩——2.6%的WER,确实是目前几家主流语音转文字模型里最低的。
但这篇发布通稿里没写的东西,恰恰决定了它能不能真的拿来开会用。
两个模型,两套账本
Gemini 3.5 Transcribe分成两条产品线:实时流式用gemini-3.5-transcribe-live,走Live API,主打语音助手和字幕;预录音频用gemini-3.5-transcribe,走新的Interactions API,主打会议记录和通话分析。这个拆分本身没问题,问题出在计费和接口都跟着拆开了。
开发者API上,非流式音频输入报价$2/百万token,流式则要$3.50/百万token,两者对应的实际分钟成本大约相差近一倍。更麻烦的是,企业平台Gemini Enterprise Agent Platform给出的非流式音频报价是$2.50/百万token,跟开发者API的$2不是一个数字。同一个模型,两个价签,这种细节原文完全没提,采购前不核实很容易预算做错。
| 项目 | 开发者API | 企业平台 |
|---|---|---|
| 非流式音频输入 | $2/百万token | $2.50/百万token |
| 流式音频输入 | $3.50/百万token | 未在文中统一披露 |
| 判断 | 用来试水成本更低 | 落地前必须重新核价 |
准确率第一,速度垫底
把Gemini 3.5 Transcribe放进第三方横向基准里看会更清楚它的位置。同一套AA-WER v2基准下,准确率排序是Gemini第一、AssemblyAI第二、OpenAI GPT-4o Transcribe第三、Deepgram Nova-3第四;但把处理速度拉出来看,名次直接反过来——Deepgram的批处理速度是Gemini的六倍多。
这不是说Gemini不好,而是准确率和速度本来就是两条战线。选型时把哪个当第一优先级,答案会完全不同。
会议转录的“未完成”部分
原文里“会议记录、通话分析”的场景听起来已经解决,实际翻文档会发现三处硬约束:
- 说话人识别在预录场景最多支持八人,但三人及以上标为实验性;实时流式模式干脆不支持说话人分离,也就是说“边说边分辨是谁在说”这件事目前做不到。
- 智能清理模式(去语气词、修正口误)不能和说话人分离、词级时间戳同时打开——要干净文本就没法逐字追溯,要逐字追溯就得留着“嗯啊”和口误。
- 功能越叠越多,允许的音频时长反而越短.普通转录上限一小时,一旦加上说话人分离或词级时间戳,直接砍到三十分钟。
对法律取证、医疗记录这类必须逐字留痕的场景,这个互斥关系是硬伤,不是体验瑕疵。
这些约束不是Google藏起来的秘密,都写在技术文档里,只是没有出现在发布通稿的功能列表里。这恰恰是判断一款AI产品成熟度的老办法:看它敢不敢把限制写进主文案,而不是只看跑分。
字准是硬指标,好用是另一件事。
还有一个容易被忽略的迁移成本:预录模型只能走新的Interactions API,已经有基于旧接口generateContent构建的开源集成项目反馈无法直接调用新模型。对已经跑通一套语音管线的团队,这不是插拔升级,是要重新接线。
- 风险.法律、医疗等需要逐字记录的场景,慎用Smart模式清理后的输出作为唯一存档。
眼下值得盯的不是WER小数点后一位,而是三件事:企业和开发者两套定价什么时候统一、三人以上说话人分离何时脱离实验性、独立第三方基准跑一段时间后排名会不会变。语音转文字这门生意,故事讲的是"听得准",活下来的关键其实是"用得稳"。
