2026 年 9 月 23 日,Google DeepMind 正式公布两款全新语音合成模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。这两款模型已于前一天悄然入驻 Gemini API 与 Voices 端点,并接入 Google AI Studio、Gemini Enterprise 及 Google Vids。
表面上看,这是一次把传统的固定预设朗读升级为戏剧导演台的产品迭代;但在光鲜的声学跑分背后,Google 亮出的是一把砍向 ElevenLabs 等独立语音供应商的价格手术刀,同时在账单底部写下了一道只给三个月的限时倒计时。
导演台取代朗读机,但克隆榜单尚未交卷
长期以来,文本转语音赛道由 ElevenLabs 凭借细腻的逼真度与声线库占据标杆地位,OpenAI 的 gpt-4o-mini-tts 则依托多模态入口分食流量。传统系统往往只能调节语速或选择固定发音人,难以支撑复杂场景的连续对话。

Gemini 3.8 Flash TTS 试图打破这种局限。它允许创作者仅用自然语言提示词凭空捏造声线,并在单个脚本内调度原生双角色对白,甚至能精确插入笑声、叹息与主动倾听时的语气反馈助词。在官方引用的 Hume AI 评测中,Flash TTS 在声音设计维度拿下 71.4 分 登顶,重音建模取得 60.8 分,两款模型包揽了该评测综合质量指数的前两名。
但技术采购者需要厘清榜单的统计口径。Hume AI 评测的 Voice Design 核心考察的是用语言描述捏造全新音色的贴合度,并非衡量音频样本克隆(Voice Replication)的拟真保真度。在当时 Hume AI 设立的独立声音克隆基准榜上,Gemini 3.8 并未被收录评测。这意味它在面对高精度真人复刻需求时,实际还原水平仍然缺少第三方公允数据的支撑。
极限低价只给三个月,2027 年元旦成本翻倍
为了迅速从现有市场撕开切口,Google 在定价上采取了破坏性的打法。在折算基准上,官方明确每秒音频恒定消耗 25 个音频 token。在截至 2026 年 12 月 31 日的促销窗口期内,Flash-Lite TTS 的音频输出仅为每百万 token 6 美元(折合约 0.0090 美元/分钟),Flash TTS 为每百万 token 9 美元(折合约 0.0135 美元/分钟),且两款均保留免费调用额度。

| 模型 / 服务商 | 音频生成参考单价 | 多语言支持规模 | 计费窗口期限制 |
|---|---|---|---|
| Gemini 3.8 Flash-Lite | 约 $0.0090 / 分钟 | 101 种语言 | 2027年1月1日起翻倍至 $0.0180 |
| Gemini 3.8 Flash | 约 $0.0135 / 分钟 | 130 种语言 | 2027年1月1日起翻倍至 $0.0270 |
| ElevenLabs v3 旗舰款 | 约 $0.1000 / 分钟 | 70+ 种语言 | 标准商业目录价(按字符计费) |
| ElevenLabs Flash v2.5 | 约 $0.0500 / 分钟 | 32 种语言 | 标准商业目录价(按字符计费) |
若按每分钟 1000 字符的常规播讲速率测算,ElevenLabs 旗舰版现行单价约每分钟 0.10 美元,其实时版也需约 0.05 美元。Google 推广期的音频成本仅为对手旗舰款的 1/7 至 1/11。在多语言覆盖上,Flash TTS 官方宣称支持 130 种语言,Flash-Lite TTS 支持 101 种,相较对手形成了纸面参数上的压制。
极具杀伤力的促销价格只是门票,真正的总体拥有成本要看提价后的账单。
但开发团队在核算技术栈迁移成本时,必须注意到写在 Google 定价条款底部的硬约束:上述极低单价将在 2027 年 1 月 1 日全线上涨一倍。届时 Flash TTS 的音频 token 价格将拉高至 18 美元,Flash-Lite 也将调升至 12 美元,文本输入价格同样由每百万 token 0.50 美元涨至 1.00 美元。这不是永久性的低成本红利,而是一场典型的限时圈地战。
严苛的双录音防线与待验证的延迟指标
在声音克隆的工程实现上,实际调用流程并不像公关文案描述的投喂 30 秒音频即可那么轻巧。

API 文档给出的硬性要求显示,开发者除了需要上传 10 到 30 秒的干净参考音频外,还必须上传一段同一名成年发音人亲口朗读官方指定法律声明的独立录音。系统在比对两段素材确认发音人为同一人后,才会签发对应的调用凭据。这套双重声纹校验结合 SynthID 隐形水印与 C2PA 元数据,构成了目前大模型厂商中最为严苛的防盗录防线。但这套机制主要用于事后溯源与合规脱责,在音频被外部剪辑、混音重采样的复杂场景中,依旧防不住黑灰产的二次洗稿。
更为关键的隐患在于系统稳定性与交互延迟。部分早期采用 Gemini 语音工具的开发者曾指出,长音频合成偶现机械金属杂音或语调漂移回默认声音的现象;在本次发布中,虽然 Flash-Lite 主打低延迟和流式交互,但官方并未公开首包延迟(TTFT)或实时率(RTF)的毫秒级硬数据。在强实时的客服对齐与语音 Agent 场景下,缺乏延迟指标的 Flash-Lite 究竟能否在实际工况中替代深耕网络传输优化的 ElevenLabs Flash,仍需要社区第三方测试的验证。
- 建议.出海短剧、游戏 NPC 配音等多角色长文本团队,应在 2026 年底前充分利用 Gemini 3.8 的双角色脚本与促销红利;但对主打语音对话的 Agent 类产品,切勿盲目依据当前的促销单价重构架构,翻倍后的常态化单价与未经验证的端到端延迟才是真正的决策底色。
