Black Forest Labs 在 2026 年 7 月 23 日放出了新一代基础模型 FLUX 3,卖点不是“又一个更好看的生成模型”,而是把图像、视频、音频和机器人动作预测塞进同一套架构里联合训练。视频能力已经开放早期访问,单次生成最长可达 20 秒、自带音频的视频;图像版、动作预测和开放权重的 FLUX 3 Dev,都还排在后面几周甚至几个月才陆续放出。

这个思路比“再出一个视频模型”更值得琢磨。但目前能看到的证据,主要是 Black Forest Labs 自己拿去跟 Runway、Kling、Luma 等模型对比测出来的偏好率,独立评测和完整技术细节都还没公开。

一个模型学四种感官,赌的是什么

FLUX 3 的底层方法叫 Self-Flow,官方说法是让图像、视频、音频在同一个架构里互相“对账”:图像记录空间结构,视频补上时间维度和运动规律,音频暴露光靠画面看不出的因果关系——什么东西撞了会发出什么声音。单独学一种模态,只能学到那一种投影;四种一起学,声音要对得上撞击、动作要服从质量,模型学到的才更接近对物理世界本身的理解,而不只是某一个截面。

BFL 把这套逻辑称为迈向“视觉智能骨干”的一步,目标是同一个模型既能生成内容,也能预测动作、支撑机器人这类物理智能任务。方向上和 Runway、Kling 这类专注视频生成的产品拉开了距离,但目前只是早期访问阶段的一个检查点,不是成品。

69%到93%的偏好率,谁给谁打的分

官方公布的早期评测里,FLUX 3 Video 对 Grok Imagine Video 的偏好率最高到 69%,对 Kling v3 Pro 为 60%,对 Runway Gen-4.5 为 77%,对 Luma Ray 3.2 更是到了 93%。数字确实抓眼球,但评测方法、样本量、提示词细节都没有完整披露,本质上是厂商自己出题、自己判分。

FLUX 3 官方偏好率(厂商自测) 非独立基准,未披露样本与提示词细节 Luma Ray 3.2 93% Runway Gen-4.5 77% Grok Imagine Video 69% Kling v3 Pro 60% Seedance 2.0 52%
  • 风险.偏好率来自厂商自测,价格、推理成本、第三方基准均未公布,早期访问不等于可商用。
数字好看不等于结论成立,尤其当裁判就是选手自己。

对生成式视频和内容团队来说,比偏好率更实际的问题是能不能落地用:FLUX 3 支持用视觉参考让角色跨镜头保持一致,理论上可以把多段短片拼成几分钟的连贯叙事,音画同步也是官方重点强调的能力。但这些都还在内测阶段打磨,团队真要接入,得自己跑一遍多镜头一致性和音画同步的实测,而不是照抄发布会数字。


机器人开发者该盯的是动作预测这条线

FLUX 3 的动作预测走了两条路:一条是把动作预测直接内置进模型本身;另一条是把预训练的视频骨干当成“懂动力学”的基础,让专门的动作模型用少量任务数据微调。mimic robotics 是第一批拿到早期访问的合作方,双方基于 FLUX 3 骨干做出了 FLUX-mimic,用于灵巧操作任务,并在 Audi 的实际生产场景做了测试。

FLUX 3 分阶段开放计划 视频 已开放内测 图像 未来数周内测 动作预测 限研究/商业伙伴 开放权重 Dev 待后续发布
  • 结论.视频和动作预测共用同一个骨干,才是这次真正值得追的变量,不是哪个模型偏好率赢了几个百分点。

对机器人和物理 AI 开发者来说,值得关注的不是宣传里的“统一世界模型”这个说法,而是少量任务数据微调之后,在真实产线上的表现到底稳不稳。目前公开的只是一个合作案例,规模、故障率、量产可行性都没有细节。开放权重版本 FLUX 3 Dev 什么时候来、权重能不能自己微调部署,还得等 Black Forest Labs 后续公布。