让大语言模型去玩策略桌游,再指望它转头看懂上市公司的财务报表,听起来像是天方夜谭。刚从 Every 拆分并拿下 360 万美元融资的初创公司 Good Start Labs,最近就拿约 30B 参数的 NVIDIA Nemotron 模型做了一次这样的实验:让它在 19 世纪铁路策略桌游《1830:铁路与强盗大亨》的模拟器里接受强化学习训练,随后拉到 Vals AI 的 Finance Agent 专业金融基准上进行大考。
测试集包含 537 道深度任务,涵盖 SEC 财报调取、综合业务分析与财务建模。实验结果呈现出极端的分野:传统的单轮问答架构在游戏训练后评分仅从 21.7% 微增到 22.0%,几无变化;但多轮终端 Agent 架构的得分却从 12.1% 一跃拉升至 18.3%,相对增幅超过 51%。
跑分暴涨的背后:AI没有学会金融,只是戒掉了乱答
如果仅看表面成绩,很容易得出模型通过模拟炒股理解了现实商业的错觉。但拆开评估细项后,底层的技术真相要残酷得多。

在 Vals AI 的私有测试集中,模型的纯金融事实正确率在整个训练周期内纹丝不动,从最初的 10.5% 到阶段检查点的 12.6%,最终落点为 11.2%。也就是说,这个 30B 模型通读了《1830》里所有的股票拍卖规则,依然没有记住哪怕一条真实的会计准则。
真正驱动综合分数上升的唯一动力,是盲目自信错误的断崖式下跌。基线模型在面对无法确认的复杂指标时,有高达 83.0% 的概率给出前后矛盾或捏造的荒谬答案;而经历 100 步博弈强化学习后,这一比例被硬生生压制到了 64.5%。
它并非通晓了财报,只是学会了像账房先生一样严谨地调用终端核算。
跨域迁移的本质不是知识注入,而是工作流范式的刻印。《1830》的桌游环境给模型施加了极其苛刻的交互约束:观察棋盘状态、查阅历史账簿、写 Python 脚本验算、做出当期操作、承受客观输赢。模型没有学到金融的实质,但在强化学习的试错循环中,把「查证后再开口、调用工具再下注」的执行纪律刻进了权重。
脆弱的沙盒:确定性规则与现实反身性
以博弈游戏作为 AI 的练兵场并不是新故事。此前,创始人 Alex Duffy 观察 o3 与 Claude Opus 4 玩《外交》(Diplomacy)的直播时,就见识了前者的策略性背叛与后者的合规执拗。他们曾将 Qwen3-235B 在《外交》中微调数千局,不仅带动了 Hanabi 和 Wordle 的表现,还在客服基准 τ²-bench 以及 IBM 的工业运维基准 AssetOpsBench 上拿到了性能红利。

游戏确实是廉价的合成数据矿脉:它自带裁判,反馈密集,零成本试错。但把这种沙盒收益直接等同于投研实操,依然存在无法忽视的隐患。
独立可解释性机构 Goodfire 对该实验的检测敲响了警钟。虽然在完整测试中,终端 Agent 的引用依据得分从 21.73% 上升到了 24.51%,但在更小样本的极端压力测试下,单轮检查点的表现反而反超了多轮 Agent。目前没有任何扎实的理论证据能证明,游戏强化学习必然带来普适的引用可靠性。
更深层的断裂在于游戏与真实金融的逻辑鸿沟。策略桌游是一个闭包系统,规则写死在说明书里,没有黑天鹅,更没有索罗斯所说的反身性;而真实市场的残酷之处在于,所有参与者的预期本身就在改变规则。
- 风险.桌游训练能让模型格式规范、推演工整,但在缺乏基本面常识时,这种表面上的严谨反而更容易制造出具有欺骗性的伪权威分析。
路线对决:要闭门沙盘,还是真枪实弹?
当前大模型向专业工作流演进的路径,正清晰地分化为三个阵营。

DeepMind 依然走在古典主义的仿真路线上,试图通过 SIMA 和 AlphaEvolve 这类虚拟环境提炼通用智能体;Anthropic 则对游戏强化学习保持高度警惕,其核心担忧在于奖励篡改,对话对齐的技术一旦挪到工具调用环境,模型极易学会钻裁判空子。
而 OpenAI 选择了一条最粗暴也最昂贵的道路:直接在真实浏览器和生产级沙盒里做端到端强化学习。2026 年 9 月 OpenAI 上线金融专用服务后,Balyasny 资产管理公司已经将其 Agent 部署给约 95% 的投资团队,将宏观研究流程从 2 天压缩至 30 分钟。这种用真金白银堆出来的端到端能力,正在快速拉开与实验室沙盒的差距。
古人讲「纸上谈兵,不知虚实」。Good Start Labs 证明了游戏是一所合格的步兵教导营,能把散漫的语言模型训练成懂规矩、知进退的作业执行器。
- 结论.游戏强化学习是解决合成数据枯竭的高效过渡方案,但它只能规范行为举止,无法代替模型去直面真实世界充满脏数据与道德博弈的深水区。
