让语音模型开口做算术,一直是个吃力不讨好的工程。要么走拼装路线,把语音识别、大语言模型推理和语音合成串成三截,虽然聪明但延迟叠得让人烦躁;要么走端到端原生路线,反应快、带语气,但在数学题面前智商瞬间跌回及格线以下。

法国开源语音实验室 Kyutai 试图打破这道墙。他们基于开源的 GLM-4-Voice-9B,推出了名为 Voice of Reason 的两款 9B 端到端语音模型,已被 COLM 2026 会议接收。通过引入无 PPO 剪裁和 KL 正则化的类 GRPO 强化学习算法,Kyutai 把基座模型在口语 GSM8K 上的表现,从惨不忍睹的 27.3% 一路拉升到 77.1%。这意味着原生语音模型不需要先在后台慢吞吞转写文本,就能在单张 H100 显卡上边说边算。然而,剥开官方高跑分的外衣,这套方案背后隐藏着严重的偏科代价与落地妥协。

Voice of Reason:两种生成架构与推理表现对比 直接回答版 (Direct) 口述所有步骤,无静默思考 Token 70.3% 官方文本流跑分 基准 top-k=50 下为 65.5 ± 1.1% 平均回答时长由 41.9 秒缩短至 36.4 秒 STITCH 隐式推理版 语音块之间穿插 100-token 静默计算 77.1% 官方文本流跑分 真实语音转写评测回落至 72.0 ± 1.9% 基准 top-k=50 下为 74.8 ± 1.1%

跑分幻觉与发音落差

Kyutai 释出的两组核心数据确实吸睛:直接回答版模型拿到 70.3%,采用 STITCH 架构的隐式推理版则达到 77.1%。但读者需要看清评测口径。这两个亮眼数字均是在移除 top-k=50 约束、直接对解码文本流打分时测得的。一旦回到严格的 top-k=50 跨三种子测试,两款模型的成绩分别回落至 65.5 ± 1.1% 与 74.8 ± 1.1%。

更值得注意的是实际语音转换损耗。当研究人员调用 Qwen3-ASR-1.7B 对 STITCH 模型合成的真实音频进行转写再做评测时,其口语 GSM8K 成绩落到了 72.0 ± 1.9%。从模型内部的文本标记到听众耳中的声音,信息传递存在确定性的损耗。

横向对比更显现实残酷。采用大模型级联的传统链路(如 Gemma-4-31B 级联管线)在数学推理上可达 95.7%,而同属端到端全模态阵营的 30B 级 Qwen3-Omni 纯文本输出准确率也高达 94.6%,即便是 7B 的 Qwen2.5-Omni 亦有 84.7%。Voice of Reason 的价值不在于它在绝对实力上击败了级联霸主,而在于它证明了在 9B 这个可以用单张 H100 跑起来的紧凑尺寸下,纯端到端架构不是只能当复读机。

口语 GSM8K 准确率梯队分布 级联管线 (31B LLM) 95.7% Qwen3-Omni (30B) 94.6% Voice of Reason (STITCH) 77.1%* STITCH 前代基线 (9B) 58.7% 基座 GLM-4-Voice (9B) 27.3% * 注:77.1% 为文本流非 top-k 成绩,实际转写音频得分为 72.0%。

混合序列里的算法手术

原生语音模型之所以难做逻辑题,根源在于交错生成的固有枷锁。以 GLM-4-Voice 为例,模型是按 13 个文本标记接 26 个音频标记交替吐出结果。为了保证发音流利,模型无法自由展开大段静默文本链思考。Kyutai 团队在 16 张 H100 GPU 上完成了 1,500 次强化学习迭代,核心不是简单堆算力,而是在损失函数上动了两次精细的手术。

首先是采样温度修正。研究发现,在计算对数概率之前,必须将 logits 除以采样温度。在单次消融实验中,如果拿掉这项修正,GSM8K 的得分便会遭遇雪崩,直接从 65.5% 断崖式跌落至 12.3%

其次是音频标记折叠。在面对 26 个音频位置时,损失函数不再纠结具体发出哪个离散音素,而是将整个音频词表的概率加总成一个抽象标记,仅优化这一步该不该出现音频。这项数学技巧假设发音音素的微调不改变整体解题奖励,从而消解了庞大音频词表引入的高方差。单次消融显示其得分为 65.5%,相较于全标记优化的 64.4% 和纯文本优化的 63.8% 表现出更平稳的收敛优势。

在此过程中,团队利用 Qwen3-235B 改写的 150,616 道 Orca-Math 题目先做有监督微调,将准确率垫高到 61.7%,随后由 Qwen3-235B-A22B-2507 作为不参考标准答案的裁判模型执行奖励打分。在 100 例人工核对中,该裁判与人类判断的一致率为 88%,精准率达 80.0%,召回率为 95.2%。强化学习显现了极高的样本转化率:哪怕只喂给模型 10% 的微调数据,配合稍长的强化学习跑批,准确率依然可以达到 58.5%。

强化学习不仅教会了模型解题,更教会了它克制字数,直接回答模型的平均语时被生生压缩了五秒。

零延迟承诺与偏科代价

工程上的进步往往伴随隐蔽的妥协。STITCH 架构宣称在语音块之间穿插 100 个静默推理标记,可以在播放前段语音的同时静默计算后段,从而达成边说边想的零额外延迟。但这里的物理破绽显而易见:STITCH-R 布局要求第一段推理必须在开口之前完成。

这意味着无论后续衔接多么平滑,从用户闭嘴到助手吐出首个发音的首包音频延迟,依然被这 100 个思考标记牢牢压制。这与全双工对话模型 PersonaPlex 宣称的 170 毫秒极速打断响应,完全不在同一个工程坐标系内。

更严峻的问题在于通用能力的退化。在衡量口语通用知识的 TriviaQA 基准上,基座模型原本能拿到 40.6%,直接回答版跌落到了 34.0%,而 STITCH 隐式推理版更是暴跌至 21.4 ± 2.2%。为了在九十亿参数里强行塞进数学解题逻辑,模型的常识记忆遭遇了毁灭性的挤压。

  • 风险.Voice of Reason 目前更像是一个口语数学推理插件,而非通用助手;将其接入全能语音客服会导致常识问答水平急剧滑坡。

对于正在布局实时语音交互的团队而言,Kyutai 这次开源的实际意义在于指明了一条技术路线:无 PPO 剪裁的类 GRPO 方案在多模态对齐上是可行的。模型权重虽然开源并在单卡 H100 即可运行,但它继承了 GLM-4-Voice 许可证,学术免费而商用需要走备案通道,且官方尚未开源强化学习的训练代码。要在真实业务中抛弃级联架构,开发者不仅要等待社区解决灾难性遗忘,还得直面麦克风杂音与方言环境下的鲁棒性考验。