ElevenLabs 于 2026 年 9 月 28 日正式上线新一代语音大模型 Eleven v4 与面向实时语音代理的 Eleven v4 Turbo。新模型把单次文本请求上限推高到 10,000 字符(约 10 分钟音频),语言支持扩展至 90 余种,并宣称将首段可听语音时间压至 150 毫秒。

表面上看,这是一次补齐语音合成全部短板的升级,不仅解决了富情感表达与低延迟不可兼得的架构死结,还顺带把发音准确率基准推到了 91.7%。但如果抽掉发布通稿的滤镜,深入工程实现与早期实测就会发现,Eleven v4 绝不是一次可以直接全量切流的平替版本,它在长音频内容生产、实时业务落地和调用成本上分别埋下了不可忽视的断层。

恢复专业声音克隆,但富情感架构给严肃旁白添了乱

过去一年多,以 Eleven v3 为代表的富情感模型虽然能够生成笑声、耳语和摔门等副语言音效,但对提示词和标签的遵循精度有限,长音频制作更饱受跨段落音色漂移、单句重新生成后语调跳脱的折磨。针对这些痛点,Eleven v4 换用了能够分析整段文本基调、节奏与语境的新架构,不仅将发音基准测试得分从 v3 的 85.6% 提升至 91.7%,还在内嵌国际音标控制(格式如 /IPA_transcription/)上做出了改进。

专业克隆音色在平直长篇朗读中频繁遭遇过度饱满的情感干扰(示意图)
专业克隆音色在平直长篇朗读中频繁遭遇过度饱满的情感干扰(示意图)

更关键的变化在于功能回归。此前在 v3 中缺席的专业声音克隆(PVC)重新上线,订阅 Creator 及以上套餐的团队可以再次调用高精度定制音色;需要快速建模的场景也保留了仅需 10 秒音频样本的即时声音克隆(IVC)。

Eleven v4 架构特性在不同制作场景中的落差 动态剧情与角色配音 • 自动捕捉情境氛围与对话张力 • 稳定输出笑声、叹息与环境副语言 • 专业克隆支持多语言原生口音漫游 适配度极高 严肃有声书与技术播客 • 易触发未标记的戏剧化情绪起伏 • 偶发不合时宜的高声强调与嘶喊 • 熟悉音色出现轻微方言漂移与突变 需人工重听

然而,模型理解语境的敏锐度反噬了平铺直叙的朗读场景。来自早期社区实测的反馈表明,v4 带有强烈的自动加戏倾向。在没有主动插入情绪标签的脚本中,模型有时会把平静的客观陈述解读为戏剧高潮,冷不丁出现过度的声调上扬甚至高喊;部分长期使用的定制音色在生成超长段落时,还会出现方言口音不稳以及声底质感突变的状况。

极富表现力的副语言机制是一把双刃剑,它能拯救干瘪的游戏台词,也能毁掉严肃平稳的通篇长读。

对于流水线生产有声书、新闻播报与企业培训课件的团队而言,声音表现力过剩不是褒义词,它直接推高了人工重听审校和重新切句的工程损耗。

  • 建议.制作长篇纪实、财经有声书或严肃课件的内容团队,切勿直接全量切换 v4 引擎,先用 20-30 分钟连续中立语料进行断句压力测试,确认音色一致性后再决定是否替换。

拆解 150 毫秒跑分,网络延迟之外才是真实战场

在面向实时语音通话的交互场景中,Eleven v4 Turbo 给出了极为激进的参数:中位数推理耗时约为 100 毫秒,首段可听语音时间(TTFAS)中位数为 150 毫秒。在官方公布的双盲测试中,v4 对 Cartesia Sonic 3.6 的表现力胜率达到 81%,对 Inworld TTS-2 为 81%,对 Google 旗下的 Gemini 3.8 Flash-Lite 与 Gemini 3.8 Flash 则分别为 72% 和 65%。

150 毫秒跑分仅限本地传输,真实公网通信依然受制于老旧链路
150 毫秒跑分仅限本地传输,真实公网通信依然受制于老旧链路

但这组惊艳数字背后的测试口径存在显著前提。官方给出的 150 毫秒建立在 WebSocket 流式协议之上,且明确剔除了真实客户端与服务器之间的公网传输延迟。

主流语音模型首段音频延迟与测试环境差异 Eleven v4 Turbo(官方实验室剔除网络) ~150 ms Cartesia Sonic 3.6(Coval 独立实测) 313 ms xAI Grok TTS(Coval 独立实测) 397 ms OpenAI GPT-4o mini TTS(Coval 独立实测) 668 ms * 截至 2026 年 9 月 29 日,独立第三方 Coval 基准尚未录入 Eleven v4 Turbo 与 Gemini Flash-Lite 数据

截至 2026 年 9 月 29 日,行业内具有公信力的第三方独立评测基准 Coval 尚未将 Eleven v4 Turbo 收录进统一跑分序列。在 Coval 的真实环境实测中,Cartesia Sonic 3.6 的 TTFA 中位数为 313 毫秒,OpenAI GPT-4o mini TTS 为 668 毫秒。

把纯服务端的首帧音频生成当成整体对话交互延迟,往往会导致开发者低估真实业务的网络波动。当真实的电话网络抖动加上大语言模型生成 Token 的前序等待,用户感知到的总停顿很难单纯靠这节省下来的几十毫秒产生质的飞跃。


接口冲突与限时折扣,工程迁移面临隐性账单

除了模型本身表现与延迟层面的变量,摆在开发者眼前的还有更为现实的工程兼容性和财务成本。

限时优惠结束后接口调用成本将骤增至近四倍(示意图)
限时优惠结束后接口调用成本将骤增至近四倍(示意图)

首先是开发接口文档的不一致。ElevenLabs 目前虽然在模型目录中正式上线了 eleven_v4 和 eleven_v4_turbo,并在介绍中称其支持 Text to Dialogue WebSocket,但在实际的 WebSocket 端点参考文档里,模型路由参数依然标注为仅接受 v3 ID。这意味着依赖流式对话的底层架构若是急于上线,很容易在路由配置上遭遇异常报错。此外,新版主打的内联 IPA 音标机制,与早期开发者大量维护的历史读音词典(Phoneme Dictionary)无法做到完全平滑兼容,原本积累的专业术语读音修正规则需要重新校对映射。

其次是极具诱惑力但时效短暂的促销定价。发布初期,官方推出了大幅度折扣,这一策略固然有利于冲高初期调用量,但也掩盖了产品在真实商业模型下的长期开销。

模型版本促销折后价(10月12日前)标准牌价(每百万字符)竞品参考价(每百万字符)
Eleven v4$22.00$80.00Gemini 3.8 Flash: $16.49
Eleven v4 Turbo$11.00$40.00Cartesia Sonic 3.6: $49.00

根据官方计费说明,Eleven v4 的标准 API 价格为每百万字符 80 美元,Turbo 约为 40 美元。尽管在 2026 年 10 月 12 日前,折后价分别下压到了 22 美元和 11 美元,对于订阅了 22 美元 Creator 方案的团队还给予了两周内双倍积分额度的测试优待。

  • 风险.优惠窗口仅持续至 10 月 12 日,届时调用单价将骤然跳涨 3.6 倍。若按大吞吐量的实时客服场景计算,这一费率将远超 Google Gemini 3.8 Flash TTS 每百万字符 16.49 美元的水平,极易击穿创业团队的单位经济模型。

技术演进的账目不能只看发布会上的极限参数。Eleven v4 的确在模型表现力和发音精细度上向前推了一大步,但在生产环境里,面对一个随时可能自动加戏的语气系统、尚待独立基准盖章的端到端时延,以及倒计时结束后的高昂牌价,谨慎评估远比盲目跟风更为划算。