阿里通义千问团队拿出了语音赛道的新底牌:全套语音模型 Qwen-Audio-3.1 亮相,随之而来的还有一场激进的价格战。商业化 API 层面,TTS 降价约 70%,实时交互降价约 85%,ASR 最高降幅更是达到了 95%。

很多从业者第一反应是语音赛道要变天了。但拨开 95% 大降价与全能语音模型的宣传烟雾,台下真实的工程细节和计费逻辑远比通稿复杂。

5 款模型分立,不是单一全能大模型

许多公开报道把 Qwen-Audio-3.1 描述为一个能听、能说、还能自适应情绪的单一全能模型。这种说法混淆了产品边界。

识别与合成由两套独立模组通过跳线串联,并非单一全能模型
识别与合成由两套独立模组通过跳线串联,并非单一全能模型

在阿里的真实产品线中,Qwen Audio 3.1 主要是语音识别体系,包含开源的 Qwen3-ASR 与云端 Qwen-Audio-3.1-ASR-Flash;负责语音合成的则是独立的 Qwen3-TTS,二者并不是同一个端到端模型。

Qwen 语音体系:模块化工程管线拆解 听音识别 (ASR) Qwen3-ASR (0.6B/1.7B) 52 种语言与方言 外部 Pipeline 分离人声 合成表达 (TTS) Qwen3-TTS 独立产品 首包延迟 97 ms LM + Diffusion 混音 云端实时交互 双工流式调度层 7 种情绪标签检测 情绪自适应回复

在识别端,Qwen3-ASR 在技术报告中披露支持 52 种语言及方言,其中包含 22 种中文方言。阿里在开源社区上线了 0.6B 与 1.7B 两种轻量参数量规格的权重,主打端侧部署;云端版 ASR-Next 则补充了带时间戳的多发言人识别、噪声过滤以及 7 种情绪标签检测(surprised、neutral、happy、sad、disgusted、angry、fearful)。

在合成端,Qwen3-TTS 支持 10 种主要语言,官方公布的首包音频延迟最低为 97 ms。其进阶版 TTS-Next 采用语言模型配合 Diffusion 技术,试图在单次生成中把人声、音效与背景音一次性输出。

整个架构是典型的流水线组合,而非类似原生单模型的黑盒。

95% 降幅背后,计费单位正在悄然重构

95% 的降价幅度足够扎眼,但开发者在拉取账单前必须算清另一笔账:阿里把云端实时语音的计费模型变了。

实时语音转写舍弃了按分钟计时,全面转向按 Token 计费模式(示意图)
实时语音转写舍弃了按分钟计时,全面转向按 Token 计费模式(示意图)

传统的语音转写通常按音频分钟数直接计费,计费模型清晰可预测。但在 Qwen Audio 3.1 Streaming API 的新加坡节点上,计费模式转为了按 Token 计费:输入 0.93 美元/百万 tokens、输出 0.70 美元/百万 tokens

价格重构:降价与计费维度的跳跃 -95% ASR 标称最高降幅 -85% 实时语音交互 API Token 计费维度彻底转向

将传统音频分钟计费与主流竞品横向摆在一起,各家的商业取向非常分明:

服务提供方计费模式标称单价标称延迟指标
阿里 Qwen Audio 3.1 StreamingToken 计费输入 $0.93 / 输出 $0.70 (每百万 tokens)0.6B 首字延迟 92 ms
OpenAI GPT-4o Transcribe时长计费$0.006 / 分钟 (mini 版 $0.003 / 分钟)生态闭环,端到端打断
ElevenLabs Scribe v2时长计费$0.39 / 小时 (约 $0.0065 / 分钟)标称延迟约 150 ms
Google Gemini Live Transcribe时长计费约 $0.009 / 分钟 (支持 99 种语言)建议输入块 20-40 ms

在官方没有给出严格的音频时长与 Token 消耗兑换曲线之前,真实的降本幅度完全取决于业务的音频结构。如果长音频交互中的静音、环境杂音和长上下文被换算成密集的 Token 消耗,最终账单并不一定会呈现 95% 的直线缩水。

  • 风险.从时长计费切换为 Token 计费后,音频噪声切片与多轮长会话上下文会加速消耗配额,开发者需先跑通小流量测试真实吞吐成本。

纸面延迟与工程暗角

官方技术报告中,0.6B 规格的 Qwen3-ASR 在高并发基准测试下的首字延迟(TTFT)低至 92 ms。第三方 Rust 开发者在 Apple M5 Pro 硬件上对 28.2 秒音频进行离线测试,中位数转录耗时为 613 ms,MLX 实现耗时为 688 ms。

伪流式管线中音频缓存的层层堆积,导致长对话延迟呈线性恶化(示意图)
伪流式管线中音频缓存的层层堆积,导致长对话延迟呈线性恶化(示意图)

这证明小参数模型在端侧设备上的离线纯推理速度确实够快。但把它放进真正的双工流式服务里,情况有了变化。

纸面上的首字延迟,永远不能直接等同于用户耳边的真实打断体验。

社区 Issue 反馈显示,其官方参考流式实现存在伪流式缺陷。系统在处理过程中会重复累积先前的音频片段,导致长对话中的延迟呈现线性递增,进而引发卡顿甚至无响应。官方宣传的 92 ms 首字延迟,并不能直接掩盖这种管线设计带来的长会话瓶颈。

与此同时,ASR-Next 标榜的多发言人识别也不是单模型原生具备的能力,开源实现中依然需要挂载 CAM++ 或 pyannote 等传统流水线工具来处理。至于那 7 种情绪标签,目前也缺乏跨语种、防幻觉的独立客观基准评测。

四国杀格局下的突围与落脚

今天的全球 AI 语音战场已经分化成几种鲜明路径:ElevenLabs 依靠高保真表现力牢牢筑起商用门槛,其 Flash 与 Turbo TTS 标称延迟能做到 75 ms 级别;OpenAI 借助 GPT-4o 推进智能体全双工原生交互;Google 则依靠 Gemini Live 铺开 99 种语言的覆盖面。

轻量化权重专为边缘终端打造,以离线引擎保障本地多方言识别
轻量化权重专为边缘终端打造,以离线引擎保障本地多方言识别

阿里的突围路径非常务实:不硬拼高保真拟真合成,而是用 0.6B 与 1.7B 的轻量权重抢占端侧设备,用 22 种中文方言构筑本地场景护城河,再用凶狠的 API 降价去冲刷对价格极度敏感的转录市场。

天下熙熙皆为利来。这场 95% 降幅的声浪,是阿里在云端推理和模型生态底座上砸下的重锤。

  • 建议.如果做纯离线转写、边缘硬件部署或重度依赖中文方言的业务,开源的 Qwen3-ASR 极具性价比;但若要构建需要极致自然打断的高并发长对话 Agent,当下的混合工程管线仍需要团队投入大量精力去做二次补丁与延迟调优。