让大模型看一张静止照片,然后自己写出一套 Blender 脚本,把平面的桌椅板凳还原成三维场景。这个被称作 Image-to-Code 的路线最近拿出了新成果 LEGO-Anything,看似跑通了工程闭环:大模型写出的 Python 代码几乎次次都能在 Blender 里正常编译并渲染出图,代码有效率接近 100%。
但在代码全绿的表象之下,几何事实却很残酷。最新发布的评测基准 LEGO-Bench 显示,即便是综合能力最顶尖的 GPT-6 Astra,在闭环纠错时不仅很难把模型越改越准,反而经常出现将场景得分从 33.9% 一路改崩到 4.4% 的灾难性倒退。
综合高分背后的账目水分
公众常常把多模态模型的外观模仿能力当作空间理解能力。在这次涉及 8 个环境、17 个主题、104 个逻辑场景及 443 个注册资产的 LEGO-Bench 测试中,GPT-6 Astra 跑出了室内 53.4%、室外 39.6% 的综合分,大幅压制了老一代模型。较弱的 GPT-5.6 系列室内综合分仅在 14.1% 至 15.4% 徘徊;横向对比其他代码与几何基线,VIGA 为 15.6%/12.6%,Gen3DSR 为 30.1%/14.0%,3D-RE-GEN 室内仅 6.3%,REST3D 室内为 2.8%,而 SceneGen 只有 3.4%/0.5%。
但 LEGO-Bench 的综合得分公式是有效性乘以重建分与外观分的均值。所谓的 53.4% 综合分,很大程度依靠了像素级的外观重渲染相似度(RGB 误差阈值 30/255 内的像素占比),以及近乎满分的代码执行率。
如果抽离表面贴图,仅核算 5% 深度缩放容差且不给二次缩放对齐的纯可见表面重建分(Reconstruction F1),GPT-6 Astra 的室内成绩实际上只有 52.4%,室外更是跌至 34.0%。更致命的是,这项指标只检验了相机视角正对的那层可见外壳,完全没有考核被遮挡的背面几何、拓扑结构和物理重力合理性。大模型拿出的更像是一个单向立起来的舞台布景,而不是真正的三维空间。
盲人修车:跌破五成的自评准确率
在传统软件工程里,智能体靠写代码、跑测试、看报错、再修正的循环无往不利。但在单目 3D 生成任务中,这种闭环彻底失灵了。
轨迹分析显示出三个极其普遍的失败阶段:模型场景初始化薄弱,过早耗尽推理预算;修改动作没有长远规划;以及最根本的病灶——自评估不可靠。当研究人员让模型对比前后两个版本哪一个更贴近原图时,模型在几何层面的判断正确率跌破了 50%,甚至不如扔硬币随机猜测。
盲人骑瞎马,夜半临深池。因为看不出深度与遮挡关系的优劣,模型在后续迭代中经常自信地把先前的正确成果覆盖掉。Astra 在测试中就把一个原本已达 33.9% 重建分数的半成品,一步一步反向改毁到了 4.4%。
- 风险.缺乏物理测量尺度的自省闭环不仅不能收敛,反而会成为几何误差的发散放大器。
研究团队给出的补丁是一个免微调的外部插件 LEGO-Plugin。它做的事情非常简单:剥夺模型的自我几何判断权,强制接入硬性物理度量,并加上类似 Git 的版本保护机制,一旦改退化立刻回滚。这项机制让弱模型在 42 个用例的 Office 子集上拿到了最高 62.7% 的相对增益,但对于最强的 GPT-6 Astra,提升幅度仅有微弱的 2.1%。这坐实了一个现实:外部工程脚手架只能帮弱模型挡住语法和操作性犯错,救不了前沿模型在单目几何推理上的认知上限。
虚浮的三维,撑不起现实的感知
在路线分歧上,NeRF 和 3D Gaussian Splatting 擅长真实渲染和多视角漫游,但产物是一团无法直接交互的点云或隐式场;LEGO-Anything 坚持的代码化路线(Code-as-Scene)生成的是 Blender 场景树,资产自带语义,可二次编辑。这是图形学与具身智能极度渴望的资产形态。
能够写出合法代码,不代表模型理解了代码映射出来的物理实体。
但当研究人员试图用这些逆向生成的 3D 场景去支撑现实中的通用视觉任务时,结构层面的虚浮原形毕露。场景自带的对象检测 Box AP 只有 30.14,而专用的 DINO 可以达到 59.88;实例分割 Mask AP 仅为 14.75,而 Meta 的 SAM 3 能做到 53.96;深度估计绝对相对误差(AbsRel)更是达到 0.1554,落后于 Depth Anything 3 的 0.0783 一倍以上。
- 建议.下游工具链切忌直接采信单图逆向的三维资产,空间计算与具身环境的建立,依然需要显式的物理传感器与几何约束兜底。
从文本代码的逻辑自洽,跃迁到三维物理的几何自洽,中间隔着一堵大模型光靠调大上下文与思维链跨不过去的墙。它能完美理解 Blender 脚本的语法规则,却在面对一堵墙、一张桌子的三维距离时失去了度量衡。单图瞬间生成工业级可编辑资产,依然是个尚未被真正攻克的远期命题。
