Google给Gemini 3.5系列添了两个新模型:面向文件转录的gemini-3.5-transcribe,和面向实时流的gemini-3.5-transcribe-live。最直观的卖点是自动删除“嗯”“啊”之类的口头禅——这也是它被报道时最先被注意到的一点。但真正值得琢磨的,不是它删掉了什么,而是它删的时候,凭什么保证没有顺手改掉别的东西。

这两个模型是今年5月发布的Gemini 3.5家族的延伸,官方文档更新到8月26日。转录能力被拆成两种模式:Verbatim(逐字)默认保留所有停顿和填充词,Smart(智能)负责清理口吃、重复、自我更正,还会自动加标点、格式化数字和货币。前者面向需要原始记录的场景,后者面向想要一份能直接拿去用的稿子。

两种模式,两种用途

问题在于,Smart模式目前不能和说话人分离(diarization)、词级时间戳同时打开。Google自己的文档承认,一旦开启词级时间戳,整体转录准确率会下降。这意味着如果你既想要“谁在什么时候说了什么”,又想要“说得干净漂亮”,Gemini现在给不了。

两种转录模式,功能互斥 Verbatim 逐字模式 保留 um / uh / like 可配合说话人分离 可配合词级时间戳 适合法律 / 学术 / 字幕 可验证性:高 Smart 智能模式 去除口吃、重复、自我更正 不能同时开启说话人分离 不能同时开启词级时间戳 适合会议纪要 / 播客文案 可验证性:待观察

价格上,gemini-3.5-transcribe按音频输入和文本输出分别计费,混合成本约每分钟0.005美元;实时版transcribe-live混合成本约每分钟0.009美元。免费层的内容可能被用来改进产品,付费层官方声明不用于训练——但“零数据保留”并不是默认打开的,开发者得自己设置store:false,Live API的会话状态还可能保留最长24小时。这对企业客户是笔容易被忽略的合规细节。

支持语言超过85种,能在对话里自动切换语种,覆盖美式、英式、印度英语和巴西、欧洲葡语这类区域变体。硬性限制也不少:文件转录单次最长1小时,一旦开启分离或时间戳就压缩到30分钟;实时会话上限10分钟;说话人分离最多支持8人,超过3人还是实验性功能;自定义词表最多1000条,官方建议控制在100条左右效果最好。

转录引擎不是剪辑软件

Gemini 3.5 Transcribe解决的是文本层面的问题:把语音变成一份读起来顺的稿子。它不动音频本身。如果你要的是从视频源文件里真的把“嗯啊”剪掉、让画面和口型对上,这不是转录模型的活,是像Descript这类剪辑工具在做的事——Descript今年2月的更新还专门宣称填充词去除性能提升了43%,走的是从音视频源头物理剪除的路线。

两者不在同一层竞争。Gemini在API和开发者生态里铺得更广,Descript在内容创作者的剪辑工作流里扎得更深。Google已经把类似的清理能力做成macOS版Gemini App里的“智能听写”消费功能,7月29日上线,目前只支持英语。这更像是把企业级API能力下放到普通用户手机和电脑上,而不是要正面抢播客剪辑师的饭碗。


没人公布的那个数字

Google的官方博客反复强调多语言、口音、噪音场景下的表现进步,但翻遍文档找不到一个具体的词错误率(WER)或准确率百分比。没有独立评测,也没有官方基准数据可供引用。

早期使用者的反馈里能看出一点端倪。Reddit上有用户对静音时刻会不会“凭空生成”内容表示担心——比如凭空冒出一串电话号码——并且希望有人拿它和ElevenLabs Scribe这类产品做独立对比,而不是只看Google自家演示。更早之前,Hacker News上有人用通用版Gemini 3处理一段90分钟播客,报告出现了虚构引语、错误时间戳,以及大量没有标注的转述改写。这测的是旧版通用模型,不是这次新发布的转录端点,不能直接当成对新模型的判决。但它提示了一个方向:清理填充词和生成式幻觉,在同一套模型里可能只隔一层。

  • 风险.Smart模式在“让文本更好读”的同时,缺少可核对的准确率数据,用户很难判断它是否顺手改写了原意。
好读的转录稿,不等于可信的转录稿。

这条界线对不同人的意义完全不一样。记者、律师、学术研究者需要的是逐字记录,一旦Smart模式被误用在这些场景里,被清理掉的可能不只是语气词,还有陈述里的犹豫和自我修正——而这些恰恰有时候才是重点。会议纪要、播客文案的使用者反而乐见其成,他们要的本来就是一份顺手能用的稿子,不在乎多几个字被吞掉。

Gemini 3.5 Transcribe目前已经在macOS版Gemini应用和Android的Rambler听写功能里向部分地区推送,开发者可以通过AI Studio和Antigravity拿到公测权限,Chrome端支持还在路上。接下来真正值得盯的,不是它删了多少“嗯啊”,而是有没有人拿出独立的准确率评测,以及Smart模式在长音频、多口音场景下的幻觉率到底有多高。在这两个问题有答案之前,法律、新闻这类要求逐字记录的场景,最好还是老老实实用Verbatim模式,再回去核对一遍原始音频。