一个随机生成的四足机器人被要求完成一次抛掷动作,还没做完就自己先摔倒了。这是斯坦福团队论文演示视频里的一幕。

机器人的身体设计,长期靠人工试错和黑箱优化在赌运气。这次他们想换个做法。

他们的方案叫Transformer Transformer,一个统一的扩散模型。输入一段目标动作和一个奖励函数,它直接生成整套机器人身体——连杆、关节、电机、惯性参数一个不少。再用同一个模型去控制这具刚生成的身体。

团队在ALOHA双臂平台上做了一次实物验证。抛布任务里,新设计比原始设计跟踪误差降了73%,最大关节速度降了30%。这是目前唯一公开的实物结果,不是普适结论。

一个模型演三个角色

传统的机器人协同设计,是"设计一个、仿真跑一个、人工判断一个"的循环。慢,而且设计和控制往往是两套互不理解的系统。

Transformer Transformer把三件事塞进同一套权重。给定目标末端轨迹,模型直接扩散出一整套机器人身体。换一种输入掩码,同一个网络又变成跨具身的控制器,去驱动刚生成的机器人执行任务。生成和控制用的是同一个模型,设计对不对,它自己就能跑一遍验证。

这套机制能成立,靠的是一种叫RoboTokens的统一编码方式:把连杆、关节、电机这些"身体"信息,和状态、动作这些"动力学"信息,编码进同一个token序列。团队测试了11种机器人,从0.65公斤的灵巧手到67.5公斤的四足机器人,每一种都能压缩成28到101个token,比用MJCF文本描述紧凑27到110倍。

压缩得够小,才轮到"端到端扩散"这件事——连续参数(尺寸、间距)和离散结构(几条腿、几个关节)一起被模型直接生成出来,不用像传统方法那样一行行写机器人描述文件。

一个模型,三种角色 演示 输入目标 末端轨迹 生成 扩散出完整 机器人身体 验证 同一模型 驱动并控制 生成器·评估器·控制器,同一套权重

靠自己猜奖励,而不是重新训练

真正的技术焦点在后半段:怎么让模型优化一个它从没见过的奖励函数?

团队的做法叫Dynamics Self-Guidance。模型自己预测机器人的动力学状态,把预测结果喂进用户写的奖励函数,得到一个可微的"预测奖励",再把这个奖励的梯度反向注入扩散过程,一步步把设计拉向高奖励的方向。整个过程不需要为每个新奖励重新训练模型。

跟传统黑箱优化器比,差别很直接:

方法设计方式验证手段速度特征
CMA-ES黑箱进化搜索每个候选都要在MuJoCo里跑仿真、用真实控制器验证慢,靠反复试错
随机采样直接随机生成无优化引导快但质量不可控
Transformer Transformer扩散生成+自引导求梯度用模型自身预测的动力学替代仿真循环快,但约一分钟后提升进入平台期

测试时加大采样规模带来的提升,大约一分钟后就见顶,不像大语言模型那样"多想一会儿就更好"。团队自己也写明了这个边界。

实物验证目前只有一个案例:ALOHA双臂平台上的抛布任务。73%的跟踪误差下降和30%的最大关节速度下降,都是这一个任务、这一个设计对比原始设计得到的结果,不是跨机器人、跨任务的平均水平。仿真里的四足机器人、类人机器人实验,目前还停留在仿真阶段。

风险也很直接:奖励函数仍由人来写,模型只会诚实地把写歪的目标优化到底。预测动力学和真实仿真的误差,也可能直接带偏设计方向。

唯一一次实物验证 -73% 跟踪误差下降 -30% 最大关节速度下降 ALOHA双臂平台·抛布任务·单案例对比原始设计

谁该关心,接下来看什么

对机器人研究者,这套方法值得复现,但复现的重点应该放在RoboTokens的编码方式和Dynamics Self-Guidance能不能迁移到自己的任务上,而不是直接套用73%这个数字——那是单个任务的单次对比,换个任务、换个平台,大概率不是这个比例。

对具身智能工程师,现在还不到把这套流程接入产线的时候。仿真到硬件的落差一直是机器人研究最容易翻车的地方,一个ALOHA案例证明的是"这条路走得通",不是"这条路已经跑顺"。更现实的动作是先跟踪团队有没有拿其他机器人平台、其他任务做第二次实物验证,再决定要不要投入自己的硬件资源去试。

对关注AI改变硬件设计的读者,值得记住的是分工正在松动:以前身体设计是机械工程师的活,策略优化是AI的活,两边靠仿真对齐。现在同一个模型能同时干这两件事,意味着未来机器人团队里,懂奖励函数设计的人,可能比懂机械结构的人更早决定一台机器人长什么样。

我的判断

荀子说"假舆马者,非利足也,而致千里",工具不天生跑得快,是人借了工具的力。机器人策略也是同一个道理——策略再聪明,身体不对,照样跑不远。

这篇论文真正有意思的地方,不是又训练出一个更强的控制器,而是把"身体该长什么样"这件事,从人工试错和CMA-ES式的黑箱搜索,往前推了一步:让模型在推理阶段直接对着奖励函数求梯度,把设计往目标上拉。

代价也很清楚。CMA-ES慢,慢本身留了容错的余地;扩散模型快,错误传导得也快。测试时一分钟左右就见顶的规律说明这不是靠堆算力就能无限提升的"思考",更像一个在有限设计空间里找局部最优的工具。

真正决定这套方法能不能走出论文的,还是仿真到硬件那道老坎。一个抛布任务、一次ALOHA实物验证,证明的是路走得通,不是路已经走完。接下来最值得盯的,不是它又生成了多炫的机器人造型,而是有没有更多硬件团队愿意把自己的任务扔进去做第二次、第三次实物验证。仿真里跑得漂亮的设计,拿到真实世界里摔一跤,历来是机器人研究最常见的剧本。