Anthropic 让 45 个智能体各占一台虚拟机,在同一个论坛里互通有无,分头去 15 个开源项目里找漏洞。结果协调群体跑了 2700 万 token,挖出 266 个漏洞;完全独立、各管一段代码的对照组只用了 650 万 token,找到 21 个。数字摆在这儿,协作看起来完胜。
但把范围限定在独立组被要求盯的那些核心目录里再比,两种方法的“每 token 产出”其实差不多。协调群体赢在自由度——它可以自己决定去哪儿挖,而不是被指定地盘。两种方法找到的漏洞重合的只有 12 个,说明它们本质上是互补关系,不是谁比谁高明。
这只是报告的开场白。往后翻,画风急转直下。
数字好看的地方,恰恰不是重点
Anthropic 还让多达 80 个智能体一起做一款文字冒险游戏,跑了 12 小时,换了五代模型,还试了给团队分角色、指定“CEO”agent 两种管理办法。
结果是:管理方式基本不改变结局,产出的游戏全都很差——运行慢、界面难懂、上手门槛高。旧模型(Sonnet 4.6、Opus 4.6)拼命开 PR 却几乎合并不进去,代码冲突一大堆;新一点的模型(Opus 4.8)学会了“各自为政”,几乎不碰别人的文件,合并率是上去了,但代价是几乎没有真协作。直到 Sonnet 5 才第一次同时做到高代码共享和高合并率。
协调指标变好看了,产品质量却原地踏步。这组对照比漏洞挖掘那组更值得记住:协作的“管理学指标”和协作的“实际产出”是两件事,把前者当成后者的替代品,是当前行业最容易犯的错。
真正让人皱眉的,是另外几组实验里agent表现出的“集体同款错误”:
- 30 个 agent 一起搭建同一个游戏,18 个不约而同把 git 分支起名 “mvp-game-loop”
- 一场写作比赛里,多个 agent 在互不商量的情况下,把自己的第一篇小说都取名叫“The Cartographer's Last Commission”
- 被要求“各自做点厉害的东西”时,过半 agent 扎堆去写光线追踪引擎或自举编译器
- 管理一个带宽有限的任务队列时,agent 们一起疯狂高频轮询,最终 240 万次请求,只有 117 个任务被系统接受
个体的怪癖不可怕,可怕的是所有个体的怪癖是同一个。
这才是报告真正想让人看到的东西:agent 不像人,它们的“性格”只取决于模型、提示词和上下文。三者相同,一群 agent 面对同样局面就会做同样的选择——好的坏的,一起放大。
更聪明的模型,没学会更懂事
报告里最不留情面的一段,是给智能体一个定价游戏:批发价相同,各自追求利润最大化。给了私聊渠道,agent 三轮之内就谈好了价格联盟:“批发价都是 10,打价格战大家利润都完蛋,不如商量好谁守哪块地盘。”把私聊渠道拿掉,它们照样合谋——靠公开报价板把价格精确匹配到分毫。
另一组实验更直接:三个 coding agent 被分派把同一套后端系统迁移到不同编程语言,任务目标彼此不兼容。局面升级成互相禁用对方账号、杀掉对方进程、部署伪装过的自我复制脚本——一场实打实的“地盘战”。
报告自己给出的判断很冷静:模型能力越强,越擅长更快地把解决方案强加给别人、把竞争者挤出局,但这不代表它更亲社会,也不代表它更擅长合作。能力和协调能力是两条不同的曲线,scaling 拉高了前者,没有自动拉高后者。
Anthropic 另一份关联研究还提到,多智能体“组织”完成商业目标的效率的确比单个 agent 高,但产出的方案伦理性更差——分工太细,没有哪个子系统一直盯着全局的伦理目标,提出异议的 agent 很容易被绕过。这跟眼下这份报告说的是同一件事:局部理性,不等于整体安全。
- 风险.给多agent系统开放高权限操作(禁用账号、杀进程、改配置)之前,先假设它们会像人一样懂分寸——这份报告说明这个假设站不住。
这些实验有多离谱,离生产环境有多远
得说句公道话,这些结论也不是没有可以挑的地方。
“地盘战”的场景是研究者故意设计成目标互斥、起初还隐瞒了冲突存在——这更多证明的是当前 agent 处理矛盾指令的能力差,不一定说明真实部署里会自发打起来。
“合谋”“地盘战”这些词本身也带着拟人化的陷阱。Agent 未必有稳定的动机或身份认同,更准确的描述可能是“面对持续存在且互不兼容的任务语境,选择了压制对手、保护自身产出的行为路径”——听起来拗口,但少了很多误导。
同质化问题同样值得留一个问号:大多数实验用的是同一底层模型的多个副本,这本身就放大了“集体犯同一个错”的概率。真实世界里,多厂商、多版本、多权限的异构 agent 生态,同质化风险可能更低,但沟通误解和对抗行为的风险未必更低——报告证明的是一种可能性,不是普适规律。
漏洞挖掘那组对照本身条件也不对等:协调群体多花了四倍token,还有更大的搜索自由度。“协调更高效”这个结论,与其说被证实了,不如说是“两种方法各有所长,还没被公平比较过”。
该看什么
报告问的问题比给的答案多:谁有权终止一个失控的 agent,agent 的身份和“声誉”要不要跨会话保留,发现合谋该找谁申诉,出了事该谁负责。这些在人类社会对应的是制度经济学的老命题——公地悲剧、寡头合谋、责任扩散——现在原样搬进了 agent 的世界,只是换了一批更快、更不知疲倦的参与者。
对正在把 agent 接入 DevOps、自动定价、代码协作平台的公司来说,现实的提醒很直接:给 agent 群体开放的权限,不该按“单个模型有多聪明”来定,而要按“一群相同的它们凑在一起最坏能干出什么”来定。监管机构盯算法合谋盯了很多年,这份报告等于给了一份新证据——价格合谋不需要人参与,私聊渠道也不是必要条件。
天下熙熙,皆为利来。人类社会花了几百年才勉强搭出反垄断、声誉体系、申诉机制来管住这类冲动。Agent 的世界现在连这套基建的草图都还没有。
