Google在8月26日把语音转文字这条产品线换了引擎。新模型叫Gemini 3.5 Transcribe,公开预览,一路铺到手机键盘、Mac上的Gemini App、开发者工具,Chrome浏览器也快了。官方给出的数字确实好看:错误率降到5.5%,转录延迟砍掉七成。但通稿里没提的是,这款模型的"聪明"是有代价的——它会在你不知道的时候,替你改了词。

一个模型换了两个引擎

Gemini 3.5 Transcribe其实是两套系统。预录音频走gemini-3.5-transcribe,实时流式走gemini-3.5-transcribe-live,后者靠WebSocket传输,专门服务字幕、直播这类场景。目前已经上线Pixel手机键盘的Rambler功能、macOS版Gemini App的语音输入,开发者可以在Antigravity、AI Studio和API里直接调用,Chrome"即将上线"——到时候任何网页输入框都能语音打字。

支持85种以上语言,还能在一句话里自动切换语种。自定义词汇表最多塞1000个术语,但官方自己建议控制在约100个,多了效果反而打折。预录音频最多识别8个说话人,3人以上的归属判断官方标注为"实验性"。

价格压得很低,预录音频综合成本约每分钟0.005美元,实时流式约0.009美元——这个价位足以让Whisper生态、Deepgram这类专业转录服务商感到压力。

Gemini 3.5 Transcribe 关键数字 5.50% FLEURS流式错误率 Chirp3对照7.32% 70% 语音到文本延迟改善 较上一代Chirp3 $0.005 预录音频每分钟成本 综合音频+文本输出价

这些数字都是Google自己测的,基于Artificial Analysis和FLEURS两套基准,不是第三方独立复现的跨语言横向测试。放在通稿里很漂亮,落到具体口音、专业术语、嘈杂环境里会不会打折,目前没人验证过。

更聪明,不等于更忠实

模型最大的卖点不是听得准,是"听得懂你想说什么"。Smart模式会自动删掉"嗯""啊",处理你说错重来的自我纠正,最后输出一段读起来很顺的文本。

官方文档里写着一个很容易被忽略的限制:Smart模式和词级时间戳、说话人分离功能互不兼容。想保留发言时间戳、想区分谁说了哪句话,就必须切回Verbatim逐字模式——那样又会保留所有口误和重复。

Smart 模式 vs Verbatim 模式 Smart 智能模式 ✓ 删除口误停顿 ✓ 处理自我纠正 ✓ 输出更连贯 ✗ 不兼容时间戳 ✗ 不兼容说话人分离 Verbatim 逐字模式 ✓ 兼容时间戳 ✓ 兼容说话人分离 ✓ 保留你原话 ✗ 保留全部口误重复 ✗ 读起来不够顺

换句话说,这款模型做不到同时"读起来顺"又"可核实"。它在优化可读性的时候,实际上是在用AI的推理重新组织你说的话,不是单纯转录声音。对着手机随口念一段备忘录,这种优化是好事;一旦涉及会议纪要、法律陈述、医疗问诊记录,"重写"就变成风险——转录文本不再是你说的原话,而是模型认为你想说的话。

转录本该记录事实,现在它开始替你二次创作。

付费不等于零留存

隐私条款里也藏着一个容易被误读的细节。免费版提交的音频和文本可能被用来改进产品,还可能经人工审核,这一点很多人能猜到。付费版承诺"不用于训练",但这不等于"零数据留存"。

Interactions API默认开启状态存储,除非开发者手动设置store:false;上传到File API的文件会一直保留,直到用户主动删除;如果开启会话恢复,实时会话状态最长留存24小时,内存缓存的有效期也是24小时。

  • 风险.付费版的隐私边界需要开发者主动配置才能收紧,默认状态不是很多人以为的"即用即焚"。

对企业客户来说,接入这套API之前,光看"我们不用你的数据训练模型"这句话是不够的,还得去翻配置项。


谁该用,谁该再等等

这套模型最适合的场景很清楚:语音输入打字、直播字幕、播客整理草稿、会议记录的初稿。这些场景对"准确到每个字"要求不高,对"读起来顺、省时间"要求很高,Gemini 3.5 Transcribe的定位刚好对上。

法律取证、医疗问诊记录、合规审计这类对转录忠实度有硬性要求的场景,Smart模式的默认改写和Verbatim模式的功能阉割,都是明确的减分项。一份独立评测给出的判断很克制:预览体验能打8分,生产环境的可信度只有6分——不是模型能力不够,是它的产品设计本来就没打算做"法律级别的忠实记录"。

  • 结论.这是一款为效率场景做的转录工具,不是为证据场景做的记录仪。

Google在语音识别这条赛道上一直缺一口气,Chirp系列没能撼动市场对Whisper生态的信任。这次换引擎、压价格、塞进整条产品线,姿态很像要把ASR这个细分市场重新洗一遍。价格战打得凶,说明它对准确率有信心;但把"智能改写"包装成默认体验,又没在产品页面提醒用户"这不是逐字记录",多少是把风险甩给用户自己去翻文档。真正决定这款产品命运的,不是错误率还能再降几个百分点,而是有没有人等到一份会议纪要出错之后,才想起来查一下Smart模式到底做了什么。