Nvidia上周五扔出一个数字:同一个Claude Opus 5,不装它自研的harness,在ARC-AGI-3上只拿到30%,已经是当时所有模型里的最高分;装上以后,直接冲到100%。这个跳跃大到有点不真实,而Nvidia自己的技术博客里,其实早就写明白了——这不是一次干净的对照实验。

行业里很快传开一句话:模型不重要,harness才是真正的英雄。这句话说对了一半,错的那一半,恰恰是最容易被忽略的部分。

ARC-AGI-3是什么坎

这是一组没有说明书的2D游戏测试,AI要像人一样靠试错摸清规则、自己通关。它专门用来测长时程自主能力——不是回答一个问题,而是连续做几十上百个决策还不跑偏。OpenAI在这个榜上一直很难堪,官方成绩长期个位数,上个月自己也做了一轮harness调优研究。

harness就是模型外面那层脚手架:记忆管理、工具调用、上下文清理,把一个"会答题的模型"变成"能自己干活的agent"。近几个月,长时程agent失控删库、被诱导做出不当决策的案例已经出现过不止一次,怎么让AI在没人盯着时不跑偏,是行业公认的难题。

Nvidia做了什么

Nvidia管这套自研harness叫AVO(Agentic Variation Operators),核心是三层:主循环负责试错执行,持久记忆负责别走回头路,最关键的是加了一个Supervisor——像个"CEO",发现agent卡住或走进死路就出手拉回来。

测试结果很扎眼:25个公开环境全过、183个关卡全通、总共用了6624次动作,比对照系统VISTA少了大约12%。

AVO harness 三层结构 主循环 · 动作执行 逐步试错、调用工具,把模型变成能连续行动的agent 持久记忆 · 上下文管理 记住走过的路,减少重复探索,动作数比对照组少12% Supervisor · 监督纠偏 像"CEO"一样,发现agent卡住或走死路就出手拉回 这层判断本身也要吃算力,成本未披露

100%这个数字,少说了什么

Nvidia自己的技术博客写得很清楚:30%到100%的对比,推理设置、agent后端、记忆管理、评测流程全都不一样,这不是控制单一变量的消融实验。换句话说,拿harness的贡献不能简单等于70个百分点。

更关键的一点:100%只测了ARC-AGI-3的25个公开环境,并没有拿到决定官方排行榜名次的半私有测试集上去跑。ARC Prize自己的排行榜,恰恰是按半私有集算分的。

两套榜单,两个现实 公开测试集(自证成绩) 100% Nvidia AVO + Opus5,25个公开环境 38.3% OpenAI调两项设置后,公开集自测 均未经ARC Prize官方认证 官方半私有榜(ARC Prize) 30.16% Claude Opus 5 High,官方第一 7.78% GPT-5.6 Sol Max 决定排行榜真实名次的成绩

OpenAI上个月的调优研究其实用的是同一套逻辑:保留私有推理链、用摘要代替截断式清理,让GPT-5.6 Sol的分数从13.3%冲到38.3%,输出token还少了六倍。听起来漂亮,但这同样只是公开集自测,没进官方半私有榜。


harness红利是真的,鸿沟也是真的

把官方半私有榜摆出来看,故事就没那么戏剧化了:Claude Opus 5 High拿到30.16%,已经是官方第一;GPT-5.6 Sol Max只有7.78%,Claude Opus 4.8更是只有1.50%。模型底座之间的差距,依然是数量级级别的

harness的作用更准确的描述是:它能显著抬高同一个模型的表现上限,但没法把两个不同能力的模型拉到同一水平线。这一点在Databricks今年的成本研究里也有印证——同一个模型换一套harness,成本能差出一倍,选错脚手架比选错模型更烧钱。微软四月测19个大模型做长文档编辑,结果所有模型(包括前沿模型)都在文档里留下大量错误,说明这不是某一家的偶发问题,而是整个agent工程还不成熟。

脚手架能救场,救不了地基。

Supervisor这层机制也不是免费的。它要独立跑一套推理去判断主agent是不是走偏了,这部分算力和延迟成本,Nvidia的博客里没有细算。

  • 风险.监督层本身要消耗额外推理开销,harness带来的动作数节省,可能一部分被这层成本抵消,目前没有公开数据能说清楚。

Nvidia讲这个故事,立场也不难猜。它不靠卖模型赚钱,靠的是芯片和围绕模型的基础设施——Nemo品牌下那堆开源/半开源的harness组件。"模型不是唯一变量"这句话,对Nvidia来说既是研究结论,也是生意逻辑:用户越相信harness重要,越会去搭建自己的agent runtime,越离不开底层算力和工具链。

接下来看什么

对做agent产品的团队,这次的教训比结论更值钱:与其死磕换更贵的模型,不如先看记忆管理和纠偏机制有没有做对,Databricks的成本数据已经把这笔账算得很清楚。对Anthropic而言,不管在哪套评测口径下,Opus 5都是当前最能打的底座,这次事件等于又免费打了一轮广告。对OpenAI,官方榜7.78%和自证38.3%之间的落差会持续被人翻出来对比,压力不会小。

真正该盯的,是ARC Prize会不会推出针对harness的独立评测类别,以及各家愿不愿意把harness调优的成绩拿到半私有集上正式验证。在那之前,"100%"更像一张精心挑角度拍的照片,好看,但别拿它当全景图。