2026年9月30日,发表在《Nature》上的一项研究宣告了经典棋类领域最后一道人类防线的失守。学术界联合团队推出的AI决策系统Ataraxos,在20局系列赛中对阵西洋陆军棋(Stratego)历史最佳选手Pim Niemeijer,最终取得15胜1负4平,以平局折半计算的有效胜率高达85%。这位曾斩获4届世界冠军、15次荷兰全国冠军并雄踞世界第一超过600周的传奇老将,在长达三周的交锋中未能找到实质性的破局手段。
这场胜利的核心冲击不在于人类棋手再次落败,而在于攻破这座高墙的成本。相比此前头部科技巨头消耗数百万美元的暴力堆算力尝试,研究团队仅依靠不到8000美元的算力开销就拿下了对人类顶尖水平的实质性碾压。它向整个AI行业释放了一个明确信号:在状态极度不透明的复杂决策场景中,精巧的算法杠杆依然能打破算力军备竞赛的垄断。
8000美元对垒数百万,学术预算打破巨头神话
西洋陆军棋向来被视作人类智力博弈在棋盘上的最后堡垒。不同于围棋或国际象棋这类完全信息博弈,该游戏双方各有40枚棋子背面朝敌,暗置开局。根据论文测算,其初始布阵的可能性超过10的33次方种。相比之下,德州扑克的起手牌组合仅有1326种。以往依赖反事实遗憾最小化(CFR)的德扑类算法,在如此庞大的隐藏信息面前会直接遭遇计算爆炸。
在这项挑战上,工业界巨头曾遭遇过明显的瓶颈。DeepMind此前研发的DeepNash系统在1024个TPU节点上连续训练了两到三个月,按2025年算力价格折算,单次训练成本在300万至450万美元之间。尽管DeepNash在2023年世锦赛取得19胜9负(胜率67.9%),但在面对顶级人类棋手(包括Niemeijer)时仍旧难求一胜。
Ataraxos团队在学术预算的硬约束下走出了完全不同的工程路线。系统的强化学习自博弈仅动用了16块NVIDIA H100 GPU运行一周,其核心的信念网络(Belief Network)则由4块H100运行4天完成,整体算力开销低于8000美元。依靠自研的高效GPU环境模拟器,Ataraxos在总计生成约1.63亿局完结对局与2080亿环境步后便收敛完成。其算力开销缩减至前者的五百分之一,自博弈对局数仅为三十分之一。
动态退火与信念搜索,双引擎拆解10的33次方迷雾
在不完全信息博弈中,纯粹强化学习最容易掉入两个陷阱:策略过早坍缩为单一套路,或者在几种极化策略间陷入无限循环震荡。只要对手看穿套路,AI就会被轻易针对。Ataraxos破解这一死局的关键在于一套动态退火正则化机制。
训练之初,系统施加极强的正则化约束,强迫自身尝试分散多样的布阵和走子路线,并匹配大步长的学习更新;随着训练深入,团队像释放能量储备一样逐步调低正则化压力,将学习步长收缩至微调级别。这既防止了算法过早将某种冒险战术固化为习惯,又保证了最终策略兼具不可预测性与严密性。
在实操决策端,Ataraxos配备了专门的信念网络。在每一步落子前,该网络会结合全盘历史轨迹,推断对手未知棋子的身份分布,进而生成多种可能的对手布局进行候选推演。过去业界普遍认为在10的33次方暗棋空间里做即时搜索在算力上不可行,Ataraxos通过仅在当前决策步执行单步更新的极简设计,成功将搜索开销压缩在实盘容许的时间内。
算力堆砌只能延缓维数灾难,而概率推断与步长退火把搜索空间压缩了两个数量级。
这套方法并非针对单一棋种的定制补丁。在合作卡牌游戏Hanabi中,该架构以减少两个数量级的算力打破了所有变体的纪录;在斗地主基准测试中,它同样击败了此前的代表性系统PerfectDou与DouZero。
戴着不对称枷锁的对决,与不可避免的统计边界
为了打消外界对测试严谨性的疑虑,组织方在赛制设计上提供了充分的抗疲劳与战术对抗空间。对阵Niemeijer的20局较量被分散在三周内完成,选手获得1000美元基础出场费,外加胜局每盘100美元、平局每盘50美元的奖金激励。在2025年世锦赛表演赛中,Ataraxos面对其他参赛选手同样拿下了38胜2负(95%胜率)的战绩。
值得注意的是,这场系列赛存在着明显的结构性不对称。三届世界冠军Vincent de Boer在分析中指出,Niemeijer可以在长达三周的实战中逐步记录、研究并寻找AI策略的漏洞,而Ataraxos的权重早已冻结,无法在赛程中针对Niemeijer的个人习惯做出适应性调整。AI是在策略完全单向透明的前提下完成了这番统治。
人类选手在复盘时往往对Ataraxos的风格产生两极化的评价。在优势局中,它会果断执行人类极少尝试的高风险诈唬;在劣势局中,它展现出近乎偏执的求和拖延战术,甚至被部分对局者形容为缺乏礼貌。由于其兵力调配总能精准切中对手后方最脆弱的隐藏区域,人类观察者常将其归咎于诡异的运气,但这本质上是概率防御网络对模糊信息做出的精细折中。
- 风险.单一系列赛的样本局限依然存在。对战单一顶尖棋手的20局样本无法涵盖所有极端人类流派,且由于DeepNash原版代码已无法运行,两代AI未能在同等硬件条件下进行直接交锋,不能草率认定旧系统已被全方位超越。
此外,Ataraxos的即时搜索目前仅模拟了单个学习步,这意味着单纯通过延长每步计算时间并不能持续提升其战术上限。但对于国防推演、供应链突发博弈与高频金融做市等同样面临巨量隐藏信息的决策领域而言,这套低算力、高样本效率的信念推断框架,已经提供了一张可以直接借鉴的工程蓝图。
