2026年9月15日,小米在其官方域名上线了一个实时强化学习遥测看板,向全网直播旗下未发布大模型 MiMo-V2.6 Pro 与 Flash 版本的后训练进程。这一动作迅速引来行业围观,也随之衍生出不少关于小米突击发布新模型的误读。

这绝非一次传统意义上的新品发布会。MiMo-V2.6 目前没有开放权重下载,没有商用应用程序接口,也没有定稿的技术报告;屏幕上跳动的每一行日志,仅仅是一场仍在进行中的工业级智能体强化学习实验。这场公开直播真正重要的价值,不在于提前宣布某种性能胜利,而在于它撕开了大模型行业长期遮掩的工程黑盒,将强化学习自进化的真实算力开销、集群容错脆弱性以及基准测试的隐秘局限,原原本本地推到了聚光灯下。

MiMo-V2.6 并非成品发布,而是一场容错透明的工程实验

打开该看板,首先映入眼帘的不是精心包装的宣传海报,而是极其硬核的底层训练状态与异常告警。看板通知明确记录,就在上线数小时前,Pro 版本的训练曾因单个计算节点的显存故障被迫重启。

页面没有公开底层的图形处理器芯片型号、具体集群规模或总显存容量,显示的开销也属于内部算力记账而非对外的商业定价。截至2026年9月16日的快照数据,正在运行的 Pro 与 Flash 两个实验分支,累计消耗的算力记账成本已达 106.2万美元,吞吐数据量共计约 58.4B tokens。对于长期只能看到最终跑分和光鲜结论的技术社区而言,这种把未收敛权重、节点崩溃与实时采样日志直接挂网的做法,在国内外头部大厂中都极为罕见。

MiMo-V2.6 阶段性训练记账盘点(截至2026年9月16日快照) 累计算力记账总开销 $106.2万 Pro分支:$76.3万 Flash分支:$33.3万 累计训练采样总量 58.4B Pro已训样本:22.8B Flash已训样本:37.8B 综合百万Token均价 $18.18 Pro单价:约$35.94 / 1M Flash单价:约$8.50 / 1M

小米研究员罗福莉此前透露,团队花费了约半年时间,专门摸索将强化学习后训练作为模型自我提升手段的扩展规律。这次看板释放的信号十分直接:大模型在完成预训练与常规监督微调后,进入长程智能体与复杂代码场景时,传统的离线蒸馏正在遭遇天花板,必须转向依赖环境反馈的自博弈。

  • 结论.后训练阶段的公开遥测打破了行业报喜不报忧的宣发惯例,它展示的不是终点成绩,而是一整套探索模型自我进化规律的工业流水线。

单步消耗二十亿Token,智能体自进化的成本天花板

在预训练红利逐步收窄的当下,行业研发重心全面压向后训练强化学习。但这场探索绝非低成本游戏,看板中呈现的数据彻底打破了智能体训练轻量化的假象。

从架构上看,MiMo-V2.6 采用了全异步基础设施,单步批次设置为 1,568个输入提示词,每个提示词展开 16条轨迹采样。这意味着单个训练步内,系统就需要并发调度多达 25,088 条长程决策路径,单步生成的计算负荷高达到约 20亿 tokens。系统必须在模拟环境中实时执行代码、捕获运行时异常,并通过组内信用分配机制与多环境混合奖励,将微小的正向动作反哺给策略网络。

全异步 Agentic RL 训练回路 动态采样路由 1,568 Prompts 批次 16x 轨迹并行 Rollout 交互环境与行为验证 单步生成吞吐 ~20亿 Token 代码沙箱运行与测试判定 信用分配与策略迭代 多环境混合奖励归一化 异步梯度更新与权重同步

这种高强度的在线推演直接反映在账面上。以两者的单价对比来看,Pro 版本的百长期采样和复杂判定使其算力记账成本达到约 35.94 美元/1M tokens,而以高吞吐架构运行的 Flash 版本则压低至 8.50 美元/1M tokens。这种量级说明,当模型试图通过自主尝试来纠正深层代码逻辑时,每一次前向推演与环境交互都在快速消耗预算。

此前小米在 MiMo-V2-Flash 技术报告中曾披露过多教师在策略蒸馏与超过十万个可验证任务的训练体系。如今 V2.6 阶段的转变清晰地表明,纯粹靠教师模型投喂蒸馏数据的红利期已经结束,想要让模型在复杂软件工程中具备真正的排错能力,必须承受长轨迹试错所带来的高昂代价。


跑分除魅:DeepSWE v1.1 镜像下的能力与水分

除了算力账本,看板披露的阶段性基准同样是行业聚焦的焦点。在当前更新的阶段评测中,Pro 在训练第 8 步的 DeepSWE v1.1 成绩达到 62.24,Flash 在第 12 步达到 60.77

模型检查点 / 对比对象评测基准与环境平均得分指标状态与说明
MiMo-V2.6-Pro (Step 8)DeepSWE v1.1 (mini-swe-agent)62.24 (avg@3)训练中检查点,单步耗资显著高于Flash
MiMo-V2.6-Flash (Step 12)DeepSWE v1.1 (mini-swe-agent)60.77 (avg@3)训练中检查点,高吞吐低成本迭代
DeepSeek-V4-Pro (行业标杆)DeepSWE v1.1 (公开基准榜单)约 63%成熟对比基线,最高环境配置可达74%左右
DeepSeek-V4-FlashDeepSWE v1.1 (公开基准榜单)约 53%行业高性价比轻量模型参考水平

表面上看,MiMo-V2.6 的中期表现已经逼近了公开榜单上 DeepSeek-V4-Pro 约 63% 的水准,甚至大幅甩开 DeepSeek-V4-Flash 约 53% 的表现。但技术界不能忽视评测口径的变化。

首先是标尺的迁移。过去行业通用的 SWE-bench Verified 存在严重的训练集记忆与数据污染隐患。而 DeepSWE v1.1 覆盖了 91 个代码仓库中的 113个全新多语言任务,平均每个任务涉及 7 个代码文件和 668 行代码修改,并强依赖独立行为验证器来判定修补是否真正生效。

跑分的飞跃不等于生产力的落地,统一评估脚手架抹平了真实场景的工程暗礁。

评测设定的限制同样明显。当前看板跑分统一挂载在轻量级的 Mini-SWE-Agent 脚手架下,且采用了三次采样的平均值(avg@3)。这种标准化脚手架虽然保证了打分效率,却无法反映自适应工具链在生产系统中的抗脆弱性。更何况,独立技术审计此前已指出初始版 DeepSWE 本身存在 4 个参考方案未通过自身验证器、部分任务缺少复现补丁等瑕疵。

  • 风险.切勿将该阶段性跑分视作模型交付承诺。早期 MiMo-V2.5 曾因高性价比获开发者青睐,但在复杂软件架构重构中暴露出幻觉循环和延迟排错问题,这一工程痛点能否被强化学习真正化解,仍有待正式商用权重与 pass@1 真实指标的检验。

技术团队已表态将在未来数周内分阶段公开相关细节。大模型的技术战役正从参数规模与公关话术,转移到可验证的后训练基础设施。这场百万美元的直播,让全行业第一次真切看到了大模型自我进化的工程阻力与现实地基。