靠文生图立足的 Black Forest Labs(BFL)在 2026 年 9 月 24 日(技术报告标注为 9 月 23 日)把手伸向了机械臂。

团队正式上线专为机器人控制设计的开源世界-动作模型 FLUX 3 Action。官方给出的数字极为扎眼:参数量仅 70 亿(7B),不到此前最佳开源模型 Cosmos3-Nano-Policy(16B)的一半,却在 NVIDIA RoboLab-120 模拟基准测试中刷出第一名,宣称运行速度最高提速 3.95 倍,权重已在 Hugging Face 开源。

做视觉生成的黑马跨界做硬件控制,听起来像是一次降维打击。但在具身智能领域,把视频像素生成当成物理动作预测,真能跑通吗?

FLUX 3 Action 架构管线:视频生成模型如何驱动动作输出 多路感知输入 工作空间多相机流 冻结 Qwen3-VL-4B 指令与视觉特征编码 7B Diffusion Transformer 联合去噪核心引擎 动作 Token + 视频 Token 冻结视频 VAE 重构未来 双重推演输出 环境演化画面(预测) 32 动作 Chunk 序列 覆盖 2.13 秒(15Hz 物理控制)

拿生图模型控机械臂,BFL 赌的是什么

传统具身智能面临严苛的两难:大推理模型长于分步规划,但体积庞大、推理延迟动辄数秒,根本无法匹配毫秒级的电机控制;端侧策略网络响应极快,却缺乏泛化与物理常识。

模型单次吐出未来两秒动作块,尝试直接借视频去噪预测动作
模型单次吐出未来两秒动作块,尝试直接借视频去噪预测动作

BFL 押注的是世界-动作模型(World-Action Model)。它放弃了分步符号规划,直接借用视频生成架构,让模型在预测未来环境演化的同时,联合输出机器人该执行的物理动作。

这个 7B 模型的底层是 Diffusion Transformer,结构中嵌套了冻结的视频 VAE 以及冻结的 Qwen3-VL-4B 指令编码器。其独特之处在于动作 token 与视频 token 处于同一空间内同步联合去噪,模型单次直接吐出包含 32 个动作的 chunk,在 15Hz 的控制频率下覆盖未来 2.13 秒的推演视界。

它的预训练数据里超过 95% 是视频 token。中训阶段则塞入了对齐动作的游戏录屏、第一人称手部视频、手持夹爪数据,以及覆盖 14 种机器人实体的遥操作轨迹。除了操控机械臂,BFL 还想顺手把这套逻辑推向游戏导航和计算机操作代理。

画出未来两秒的画面,并不等于学会了现实两秒的力学。

榜首背后的偏科账单

在 NVIDIA RoboLab-120 基准测试里,FLUX 3 Action 以 515/1,200 的胜场拿下了 42.9%(官方报告为 42.92%)的胜率,力压 16B 对手 Cosmos3-Nano-Policy 的 36.8%,净胜 74 次。

视觉感知虽有优势,但面对物体遮挡与空间推理时频频失误卡位
视觉感知虽有优势,但面对物体遮挡与空间推理时频频失误卡位

表面上看这是轻量化架构的完胜,但如果把测试维度拆开,偏科迹象显而易见。

任务评估维度FLUX 3 Action (7B)Cosmos3-Nano (16B)差距分析
整体任务胜率42.9% (515/1200)36.8% (441/1200)胜率提升 6.2 个百分点
简单任务成功率49.1%较低基础动作执行稳健
复杂长程任务28.2%偏低规划能力随步数锐减
视觉感知类35.6%26.1%视觉优势扩大 9.5 个百分点
空间关系推理49.5%49.3%二者持平,几无代际增量

FLUX 最大的领先优势集中在视觉感知类任务,高出对手 9.5 个百分点。但在涉及物体相对方位、遮挡处理和空间交互的关系推理类任务上,FLUX 录得 49.5%,与对手的 49.3% 几乎完全持平。

当面对复杂任务时,其成功率直接滑落到 28.2%。这暴露出扩散视频模型跨界的先天局限:强大的视频生成先验让它极擅长辨识画面语义,但在缺乏明确三维几何标定的前提下,光靠像素自回归,并不能凭空生出高阶空间推理能力。

宣传话术与工程指标的落差对比 榜单评测显存标称 69 GB 远高于对手标称的 40 GB B200 典型加速倍率 3.15x 宣传上限宣称最高 3.95x 极速单步推理的代价值 4步引导中位延迟 182ms (成功率 42.24%) → 1步无引导延迟压缩至 32.29ms (成功率跌至 37.92%)

速度与显存的现实引力

宣传把 7B 包装成适合端侧小设备部署的典范,但工程底细经不起细抠。

原生显存占用高达69GB,轻量化端侧设备难以承受其重压
原生显存占用高达69GB,轻量化端侧设备难以承受其重压

官方称运行速度最高提升 3.95 倍。翻看技术报告,这一数据是在 B200、H200、RTX 6000 Pro 及 RTX 5090 等硬件上测得的峰值区间(1.52 倍至 3.95 倍)。在报告重点展示的 B200 芯片示例中,蒸馏版 FLUX 块延迟为 101.71 毫秒对 Cosmos 的 320.40 毫秒,实际加速倍率约为 3.15 倍。

更严峻的是延迟压缩所付出的精度代价。在 B200 的 FP8 格式下,标准 4 步引导推理的中位延迟为 182 毫秒;如果采用极速的 1 步无引导方案,延迟确实能压到惊人的 32.29 毫秒,但 RoboLab 基准成功率会从 42.24% 径直跌到 37.92%。

而在显存占用上,落差更加刺眼。在基准测试页面中,FLUX 评测配置标注显存占用高达 69 GB,反而远高于 16B 对手的 40 GB。

技术说明解释,这是未经深度裁切的标准状态;如果采用 BF16 DROID 策略,在 H200 上需约 32 GB;必须经过 FP8 量化并卸载文本编码器,才能勉强塞进 24 GB 消费级显卡。指望把它原汁原味丢进低成本机器人板载控制器,目前仍不现实。

  • 风险.端侧控制器的算力与散热预算极其严苛,离开数据中心高端卡,模型需要承受量化、蒸馏与精度骤降的连环损耗。

从实验室演示到真实碰撞

古人讲纸上得来终觉浅,绝知此事要躬行。仿真测试与受控演示,从来抹不平物理世界的不确定性。

缺乏几何标定与力学闭环,开源机械臂初测时直接撞击台面停机
缺乏几何标定与力学闭环,开源机械臂初测时直接撞击台面停机

在物理真机验证环节,Positronic Robotics 在 Franka 机械臂上设置了 10 个单物品桌面任务,双盲测试下 FLUX 录得 28/30 次成功(Cosmos 3 Nano 为 27/30)。30 次测试看似过关,但样本量太小,且局限于单物品、受控光照的整洁桌面。

真正的麻烦在开源社区爆发。有第三方开发者尝试将模型部署到低成本开源机械臂 SO-101 上,随即遭遇坐标系与 LeRobot 校准失配。机械臂在初测时直接撞击台面停机;即便手工纠偏后,最终依然未能完成有效抓取。

多相机视角的空间几何校准向来异构而脆弱,纯视觉驱动的模型缺乏物理层面的力觉闭环与统一空间参照,遇到非标硬件便立刻现形。

此外,社区对开源成色同样存疑。FLUX 3 Action 采用限制性商业授权 FLUX Kommunity License v1.0,明文限定只有年化营收低于 500 万美元的机构可进行有限商业应用,并非纯粹的无限制开源协议。更让工业界棘手的是,官方并未公开极速版的蒸馏训练方案,外部团队即便拿到权重,也很难自主复现极致低延迟的控制策略。

  • 结论.对于具身智能集成商与算法团队而言,当前该模型更适合作为多机位高视觉特征提取的研究基座,短期内切忌直接套入工业场景的物理闭环。

视频扩散模型确实为具身智能注入了强大的视觉感知能力,但工业机器人真正需要的是高达 99.9% 的确定性执行。生成漂亮的未来画面只是第一步,面对刚度、摩擦力与杂乱现实,光有像素远远不够。