大模型领域的慢思考正在演变成一场算力消耗战。许多人以为让模型多输出几千个 token 的推理步骤就是通往高级智能的捷径,但真正的瓶颈从来不是思考过程能拉多长,而是系统知不知道自己何时该停、何时该深思。

2021年10月5日,Andrea Loreggia 与 Bergamaschi Ganapini 等研究人员在 arXiv 提交了一篇仅有 6 页的理论论文《Thinking Fast and Slow in AI: the Role of Metacognition》(arXiv:2110.01834),提出名为 SOFAI 的多智能体双系统认知架构。该论文没有附带任何跑分,只是把卡尼曼的快慢思考理论搬进 AI 框架:前端由依靠直觉经验的快系统(S1)负责快速反应,后端由长于搜索与推理的慢系统(S2)兜底,两者之间由一套包含世界模型与自我模型的元认知模块负责动态调度。

SOFAI 认知架构的三层世界与双阶段裁决 任务输入 S1 直觉代理 基于先验经验 元认知判定 (Metacognition) MC1:置信度与资源检测 MC2:期望收益 vs 算力成本 基于世界模型 / 自我模型 / 他者模型 低成本快速交付 S1 直接输出结论 激活 S2 慢系统 启动深度搜索与重试

这套纯理论构想直到几年后才补齐工程实证。AI 进化的分水岭不在于堆叠更复杂的推理,而在于建立精确核算思考成本的机制。

算力账本:两阶段裁决如何运转

SOFAI 体系的真正增量不是快与慢的分工,而是它将系统升级逻辑显式化为两套确定性的元认知机制:MC1 与 MC2。

系统接收到输入后,快系统代理首先给出一个初始候选解。此时 MC1 启动,对照当前的物理资源限制与快系统的置信度做初筛。如果快系统的解足够笃定,或者硬件算力、响应时间已被锁死,系统会直接采用快系统的结果。一旦置信度未达标且资源尚有裕量,任务就会被递交给 MC2。

MC2 解决的是计算经济学问题。它不再盲目启动昂贵的搜索求解器,而是调取自我模型,评估调用慢系统可能带来的额外期望回报,是否能够覆盖调用它所产生的算力消耗与时间代价。只有当净收益明确为正,慢系统代理才会真正接手。

为了支撑这套判断,架构底部并排垫了三层支柱:

  • 世界模型.定义环境规律、任务要求以及可选动作空间。
  • 自我模型.记录系统过去的决策胜率、历史奖励、实际算力消耗以及不同求解器的技能短板。
  • 他者模型.在多智能体交互中维护对外部实体的意向判断。

没有自我模型的慢思考系统,本质上只是一个不计代价的算力黑洞。

500 个基准测试:速度与质量的折衷

2024 年,研究团队针对规划基准评测发布了 Plan-SOFAI,在 5 个经典规划领域的 500 个生成问题上完成了实测。

单独运行基于语言模型的快系统 Plansformer,平均耗时仅为 2.079 秒,但有效规划率只有 80.4%,错误率偏高;单独运行经典慢系统符号规划器 Fast Downward,有效率能拉到 90.2%,代价是耗时飙升至 8.479 秒。而挂载了元认知调度的 Plan-SOFAI 混合架构,最终达成了 98% 的有效规划率,平均耗时被压在 2.199 秒,多余规划长度仅有 1.13%。

架构 / 求解配置有效规划率平均耗时多余规划长度 (冗余度)
Plansformer (纯快系统 S1)80.4%2.079s未达标为主
Fast Downward (纯慢系统 S2)90.2%8.479s最优解导向
Plan-SOFAI (S1 + S2 混合)98.0%2.199s1.13%
LPG (单独启发式符号求解器)100.0%0.675s23.68%
Plan-SOFAI with LPG100.0%2.318s9.78%

随后的测试也揭示了混合架构的现实边界。在同一测试集中,单独使用启发式符号规划器 LPG,能在 0.675 秒 内达成 100% 的求解率,速度明显快于混合系统的 2.199 秒。但 LPG 单独运行给出的路径极不经济,规划长度冗余高达 23.68%。当 Plan-SOFAI 与 LPG 组合使用时,系统在保持 100% 成功率的前提下,把冗余度压缩到了 9.78%,耗时则升至 2.318 秒。

经典规划任务核心指标对照 (500 个基准测试) Plansformer (纯快系统) 80.4% 耗时 2.079s / 稳定性不足 Fast Downward (纯慢系统) 90.2% 耗时 8.479s / 计算成本高 Plan-SOFAI (元认知混合) 98.0% 耗时 2.199s / 冗余仅 1.13%

该团队在 2025 年进一步将成果发表在《npj Artificial Intelligence》(doi:10.1038/s44387-025-00027-5)上。研究者在 10 个生成网格、500 条受限路径导航中验证了 SOFAI 的表现:在导航成功率与纯慢系统持平的前提下,系统调用的计算资源大幅下降,同时论证了反思机制与判定阈值消融对整体系统的支撑作用。


避开经验偏见与冷启动陷阱

算得准不如判得准,不能度量自身代价的思考只是盲目内耗。

从工程实测来看,元认知架构带来的从来不是绝对维度的碾压,而是一种帕累托改进。它用微弱的时间增量换取了更高的有效性和更优的解路径。

但这也揭示出该架构目前的致命软肋:元冷启动难题。MC2 之所以能够准确拿捏收益与成本的天平,是因为它假设自我模型已经完整记录了系统在类似场景下的能力画像与算力消耗。一旦将系统置于从未见过的全新任务中,先验经验归零,元认知模块既算不准慢系统的成功概率,也估不出搜索树会膨胀到何种程度。此时,原本用于降低成本的仲裁者,本身就会退化为一个带来延迟的计算负担。

  • 风险.目前的实证数据均建立在网格导航与经典符号规划等封闭域内,将其照搬至开放域多模态代理时,元认知预测的置信度将面临非线性衰减。

当工业界还在用越来越长的提示词或暴力扩展搜索树来实现慢思考时,SOFAI 给出的参照系提供了一个冷峻的提醒。人类的快慢思考之所以高效,是因为大脑本身受制于有限的能量摄入,生来就有一套锱铢必较的能耗自省本能。AI 代理若想在现实工业场景中跑通,迟早要把精细的计算开销账本写进调度内核。