大模型行业长期充斥着一种关于自我进化的浪漫想象:要么是算法彻底取代人类完成自举,要么是人类工程师指挥代码助手把工期缩短数倍。2026年9月14日,InternLM团队发布拥有7440亿参数MoE架构的Agent语言模型Atria Dawn Preview,并随之公开了一份记录研发全流程的人机协同账单。这份基于56名研究员、769份任务记录的实证样本,击碎了上述两种非黑即白的预设。

在有明确记录的739项任务中,AI的介入率达到了96.5%。最扎眼的数据落在一个反常的评估结果上:在455个由AI辅助完成的任务中,有33.2%被研发人员评估为若没有AI在同等范围和质量下根本无法启动。AI在前沿研发中最本质的冲击,并非帮工程师早两小时下班,而是凭借机器不知疲倦的执行力,暴力拓展了过往因人力与时间成本过高而被直接放弃的实验荒原。但在掌控权天平的另一端,所谓的决策主导权正在悄然退化。

Atria Dawn Preview 研发人机协同核心指标切片 33.2% 不可行任务占比 151项任务无AI便无法立项 分布于全组27名算法研究员 28.5步 单指令动作中位数 4周内从11.0步单调递增 执行链条拉长加剧审查盲区 3.2% 人工编辑代码比例 遇阻时直接接管仅0.7% 人类退守补充上下文与诊断

边境拓宽背后:主观通胀与被动立项的交织

这151项被标记为无AI即不可行的任务,并非少数几位极客的特权,而是分散在56名研发人员中的27人身上。这意味着AI接管实验脚手架后,改变了算法团队的立项心理门槛。过去受限于排期,研究员不敢轻易探索的边缘假设、多路架构消融与复杂工具链路,现在只需下发指令即可铺开跑通。

单次指令触发近三十步链式动作,人工复核逐渐沦为悬空的印章(示意图)
单次指令触发近三十步链式动作,人工复核逐渐沦为悬空的印章(示意图)

但必须厘清这一数据的统计口径。33.2%这一数字来自研发人员事后的主观反事实评估,而非严格受控的对照组结论。它既不能与模型研发的胜任率画等号,也无法证明这些被AI强行拉扯出来的任务产出了多高比例的有效成果。在充沛的算力供给下,大量以往被工程直觉过滤掉的低价值穷举实验,极易被包装成技术边境的拓宽。

名义上的终审权无法掩盖方案制定权的拱手相让,审批者正沦为执行链条的橡皮图章。

与此同时,研发流水线本身的演进暴露了更深的控制力断层。在2026年8月7日至9月4日这四周的实测周期里,研究人员单次输入所触发的Agent动作中位数,从11.0次单调递增至28.5次。研发人员越发依赖自动执行模式,以此免去频繁手动批准的长链中断。当机器一瞬间串起近三十步推理、终端调用与环境验证时,人类哪怕把持着流程阀门,也很难在快节奏的迭代周期里逐行复核每一条底层逻辑。

议程已被锚定:名义掌控与实际权力的隐蔽位移

技术报告给出了一个颇具安全感的外壳:人类做出了85.5%的方法与参数决策,以及93.4%的目标与范围决策,最终拍板权牢牢锁在工程师手中。但在具体方法与参数的选择环节,有55.4%的备选方案最初是由AI提出来的。

核心代码编辑权重不足4%,研发人员退守为投喂背景的分诊员(示意图)
核心代码编辑权重不足4%,研发人员退守为投喂背景的分诊员(示意图)
大模型研发决策权结构:表层裁决与底层议程 表象:人类握有绝大部分终审权 目标与研究范围最终拍板 93.4% 实验方法与参数最终敲定 85.5% 实质:AI主导选项生成与纠偏执行 实验方法备选方案由AI率先提出 55.4% 方案大幅修正由AI获取反馈后自调 75.4%

认知心理学中的锚定效应在这里展现得淋漓尽致。当机器垄断了半数以上的可选路径生成,人类所谓的决策,本质上只是在算法圈定的菜单里做多选题。即便在那些被评估为无AI即不可行的任务中,人类敲定总体目标的比例依然高达95.4%,但通往目标的具体技术航道早已由模型代为铺设。

这种分工结构直接重构了研发工程师的日常动作。在588个遭遇阻塞的任务记录中,有76.0%依靠人类干预重新运转。值得探究的是干预的方式:

  • 35.2%的场景是人类为模型补充上下文或澄清具体需求;
  • 34.7%是研究员帮模型诊断症结并更换提示方法;
  • 人类亲自下场部分修改代码的比例仅有3.2%,全面接管业务逻辑更是低至0.7%。

当产出出现偏差需要大幅修改时,高达75.4%的情况是人类给出一句定性反馈,再交由AI自行重写。工程师不再是撰写核心算子与调度逻辑的工匠,而是被倒逼成为向系统投喂背景信息的技术分诊员。人类经验真正的护城河,退缩到了上下文调校与逻辑纠偏这一狭窄的断层带上。

  • 风险.当动作链跨越近三十步且代码编辑比例不足4%,一线研究员正面临底层技术细节黑盒化的隐形架空。

宣传表象之下:偏科的特化Agent而非全能大脑

针对自身性能,官方声称Atria Dawn Preview在16项评测中领先5项。然而,细究其评测分布与竞品对照,会发现这并非一个具备全面代际优势的通用基座,而是一个高度特化于检索与工具交互的垂类执行体。

模型在检索抓取上表现突出,但在核心工程架构上明显落后
模型在检索抓取上表现突出,但在核心工程架构上明显落后
测试基准Atria Dawn Preview行业标杆对手 (Claude Opus 5 / GPT-5.6 Sol)核心考量维度与落差判断
DeepSearchQA96.0对手落后深度信息检索与证据聚合能力拔尖
CyberGym86.5对手落后网络安全攻防与环境交互表现优异
BFCL v477.0对手落后函数与复杂工具调用准确率领先
SWE-bench Pro59.674.7(Claude Opus 5)真实大型软件工程修复能力差距达15.1分
Terminal-Bench 2.178.390.2(Claude Opus 5)系统级终端指令与长程环境控制差距悬殊
MLE-bench Lite86.288.9(GPT-5.6 Sol)细表位列次席,官方局部宣传存在偏差

在展现信息捕获与环境试探的自动化基准中,该模型确实展现出长板,例如BrowseComp录得92.5,AutomationBench拿到53.8。但一旦进入衡量复杂软件架构能力与系统级终端控制的核心考场,差距便迅速拉开。在SWE-bench Pro上,它以59.6比74.7大幅落后于Claude Opus 5;在Terminal-Bench 2.1上,同样以78.3比90.2被拉开代差。它无法代替顶级工程师完成全局系统重构。

更应保持审慎的是评测本身的成色。这16项榜单全数属于厂商自报结果,既未通过统一评测框架在相同计算预算与提示词策略下对齐,亦缺乏中立第三方的严格复现。甚至在公开宣传物料的图表附注中,官方宣称在机器学习工程评测MLE-Bench Lite上处于领先,但翻开其发布的详细横评底表,第一名明确属于拿到88.9分的GPT-5.6 Sol,Atria Dawn Preview仅以86.2排在其后。这种局部口径的微小涂抹,折射出大模型竞赛在自制跑分上的焦灼与水分。

  • 结论.Atria Dawn Preview的实测价值在于它如实记录了研发权力的位移,它证明了AI已是不可或缺的重型农具,但距离真正的科研自举,中间还隔着一道未经证实的深沟。