NVIDIA 抛出了一份让人侧目的技术战报:基于统一的基础底座 Nemotron 3,团队没有针对每个学科从头预训练全新大模型,而是通过轻量微调与推理阶段的搜索验证循环,在两项顶级中学生奥赛里同时达到了金牌水平。

在编程赛场 IOI 2026 上,专用模型 Nemotron-3-Ultra-CC 拿下 535.4 分,远超官方金牌线 361.12 分,甚至压过人类最高分 498.27 分;在数学赛场 IMO 2026 上,由通用、SFT 与 RL 检查点协同构建的推理系统拿到 30 分(满分 42 分),越过 29 分的官方金牌门槛。

但在被公关通稿裹挟之前,有必要先厘清两件事:IOI 的成绩来自闭门的前瞻性模拟测试,属于非官方基准,并未列入官方选手排名;而 IMO 的 30 分虽然由官方阅卷员批改,但竞赛主办方此前就曾明确声明,批改证明文本绝不等于认可背后的实验流程。双金牌并不是神话,它是一次极度昂贵的工程工程学突围。

外部蒸馏与 550B 混合架构的底色

这次负责出战 IOI 的核心模型是 Nemotron-3-Ultra-CC,开源权重名为 NVIDIA-Nemotron-Labs-3-Competitive-Coding-550B-A55B-NVFP4。它采用了 Mamba2-Transformer LatentMoE 混合架构,总参数量达 550B,实际推理时激活参数为 55B,支持 262,144 token 的上下文,已经在 2026 年 9 月 3 日以 OpenMDW 1.1 协议发布。

新大模型依靠外部专精模型蒸馏出的合成数据完成微调
新大模型依靠外部专精模型蒸馏出的合成数据完成微调

让人意外的不是庞大的参数,而是这套模型的数据供应链。在训练这台算力怪兽时,NVIDIA 并没有纯粹靠自研体系闭门造车,而是大量引入了成熟模型的蒸馏能力。

Nemotron 3 跨学科专项化链路 外部教师数据 IOI 数据源 GLM-5.2 (47.7万条) IMO 数据源 DeepSeek-V4-Pro 统一混合基座 Nemotron 3 Mamba2-Transformer 总参数 550B 激活参数 55B 奥赛落地输出 IOI 2026 得分 535.4 分 (超人类第一) IMO 2026 得分 30 分 (跨金牌线)

为了让模型吃透代码竞技,微调数据搜集了 16 个竞赛体系的 22,000 道编程题,使用智谱 AI 的 GLM-5.2 作为教师模型,生成了 477,642 条高质量合成推理链。令人意外的是,Ultra-CC 最终只进行了 1 个 epoch 的监督微调(SFT),连强化学习(RL)都没有追加。而在 IMO 数学项目上,SFT 语料包含的 414,890 条合成推理样本,则直接交由 DeepSeek-V4-Pro 生成,后续才基于 9,597 道边界题目进行 RL 训练。

这种跨国数据供应链勾勒出一个行业现实:即便是掌控顶级算力命脉的芯片巨头,在构建高阶逻辑推理的微调语料时,依然重度依赖外部专精模型的合成数据蒸馏。

吞噬 4785 卡时的测试时计算

单次 SFT 微调跑出超人类分数,关键在于测试时计算(Test-Time Compute)这个放大器。

单场竞赛推理在官方时限内消耗了数千个顶级算力卡时
单场竞赛推理在官方时限内消耗了数千个顶级算力卡时

在 IOI 测试中,模型配备了名为 GenCorrect 的迭代生成、评估与修正流程;而在 IMO 挑战中,NVIDIA 干脆组装了一套由通用模型、SFT 检查点与 RL 检查点互为攻防的三模型流水线。整套系统完全基于自然语言运作,摒弃了 Lean 这类形式化验证器,也没有连入互联网。

在 IMO 比赛的六道题中,系统在 P1、P2、P4 和 P5 均斩获 7 分满分,P3 与 P6 各拿 1 分,以 30 分压线达标。尽管后续进行了一场耗时 8 小时 25 分钟的超时运行,让 P6 解法拿到了 4 分、拼出 33 分的非官方成绩,但这套系统在官方时限内付出的算力代价极为惊人。

IMO 2026 单场解题算力消耗 提交解法阶段消耗 1,464 卡时 (GB200) 消耗 Token: 约 7.07 亿 完整竞赛运行累计消耗 4,785 卡时 (GB200) 消耗 Token: 约 23.1 亿

为完成这套证明生成与多轮筛选,仅提交有效解法阶段就消耗了 1,464 个 GB200 GPU-hours;整场竞赛运行下来,累计耗损高达 4,785 GB200 卡时 与 23.1 亿 token。这已经不是在比拼模型的顿悟能力,而是在用数以千计的顶级算力卡时,在可能解的空间里展开地毯式搜索。


脆弱的自然语言验证器

如果说算力消耗是显性账单,那么模型内部逻辑的脆弱性就是隐性暗礁。

严苛验证机制在压低误判的同时枪毙掉了超八成的正确解答(剖面示意)
严苛验证机制在压低误判的同时枪毙掉了超八成的正确解答(剖面示意)

大模型在高等数学中一直面临幻觉难题:它非常善于写出看起来条理清晰但步骤全错的假证明。为了堵住这个漏洞,系统采用了极度严苛的判定门槛,要求内部 16 票一致通过才能予以采纳。

这种设计确实把假阳率(把错证明误判为对)压到了 1.1%,但代价是内部产生了 81.3% 的假阴率。

所谓金牌水平,本质上是用超额抽样与算力轰炸,强行对冲自然语言验证器的高额误杀。

这意味着,模型自己写出了十条完全正确的逻辑证明,自身的验证器会盲目枪毙掉其中的八条以上。系统之所以还能拿到 30 分,纯粹是因为外部生成了极其庞大的候选池,哪怕八成以上的真解被冤枉误杀,剩下漏进网里的几条也足以凑出答案。自然语言在严密逻辑验证上的固有缺陷,在这里被暴露得淋漓尽致。

  • 风险.依靠自然语言自评判的推理系统并不具备真正的纠错认知,高置信度往往建立在数倍候选解被直接废弃的算力浪费之上。

谁在为这场军备竞赛买单

这套方案真正耐人寻味的地方,在于它的商业示范效应。

暴力堆叠推理算力的竞赛模式最终化作了昂贵的硬件账单(示意图)
暴力堆叠推理算力的竞赛模式最终化作了昂贵的硬件账单(示意图)

过去 Google DeepMind 依靠形式化数学语言 Lean 攻坚 IMO,门槛极高,难以复现;而 NVIDIA 这次给业界提供了一套清晰且完全基于自然语言的工程模版:一个开源底座,借由外部优秀教师模型蒸馏出几十万条专项数据,再配上一个死循环般的推理验证流水线。

对于开源社区和企业开发者,这打破了必须从头重训万亿基础模型的迷思;但对于算力市场而言,它恰好给昂贵硬件找到了最顺理成章的销路。单场奥林匹克测试就能烧掉几千个顶级 GPU 卡时,如果企业在金融风控、复杂代码生成等专业领域复刻这种模式,推理侧的算力黑洞只会越来越深。

兵马未动,粮草先行。NVIDIA 证明了基础底座专项化的广阔空间,但也悄悄把下一阶段 AI 竞赛的入场券,换算成了一张只有少数人支付得起的推理算力支票。