让大语言模型去玩策略桌游,再指望它转头看懂上市公司的财务报表,听起来像是天方夜谭。刚从 Every 拆分并拿下 360 万美元融资的初创公司 Good Start Labs,最近就拿约 30B 参数的 NVIDIA Nemotron 模型做了一次这样的实验:让它在 19 世纪铁路策略桌游《1830:铁路与强盗大亨》的模拟器里接受强化学习训练,随后拉到 Vals AI 的 Finance Agent 专业金融基准上进行大考。

测试集包含 537 道深度任务,涵盖 SEC 财报调取、综合业务分析与财务建模。实验结果呈现出极端的分野:传统的单轮问答架构在游戏训练后评分仅从 21.7% 微增到 22.0%,几无变化;但多轮终端 Agent 架构的得分却从 12.1% 一跃拉升至 18.3%,相对增幅超过 51%

跑分暴涨的背后:AI没有学会金融,只是戒掉了乱答

如果仅看表面成绩,很容易得出模型通过模拟炒股理解了现实商业的错觉。但拆开评估细项后,底层的技术真相要残酷得多。

模型并未掌握财报本质,只是在严格交互约束下戒掉了乱答
模型并未掌握财报本质,只是在严格交互约束下戒掉了乱答
两种架构在金融基准上的迁移分化 单轮问答架构 (Single-turn) 训练前基线:21.7% 训练后得分:22.0% +0.3% 知识与静态推理无跨域迁移 多轮终端 Agent (Multi-turn) 训练前基线:12.1% 训练后得分:18.3% +6.2% 相对跃升 51% (p=0.024) 置信区间 [+2.3, +10.4],体现程序性行为迁移

在 Vals AI 的私有测试集中,模型的纯金融事实正确率在整个训练周期内纹丝不动,从最初的 10.5% 到阶段检查点的 12.6%,最终落点为 11.2%。也就是说,这个 30B 模型通读了《1830》里所有的股票拍卖规则,依然没有记住哪怕一条真实的会计准则。

真正驱动综合分数上升的唯一动力,是盲目自信错误的断崖式下跌。基线模型在面对无法确认的复杂指标时,有高达 83.0% 的概率给出前后矛盾或捏造的荒谬答案;而经历 100 步博弈强化学习后,这一比例被硬生生压制到了 64.5%

它并非通晓了财报,只是学会了像账房先生一样严谨地调用终端核算。

跨域迁移的本质不是知识注入,而是工作流范式的刻印。《1830》的桌游环境给模型施加了极其苛刻的交互约束:观察棋盘状态、查阅历史账簿、写 Python 脚本验算、做出当期操作、承受客观输赢。模型没有学到金融的实质,但在强化学习的试错循环中,把「查证后再开口、调用工具再下注」的执行纪律刻进了权重。

能力重构实测:作风改善 vs 认知停滞 盲目自信错误率 (Confidently False) 基线 83.0% Step-100 降至 64.5% (-18.5%) 金融事实准确率 (Fact Accuracy) 基线 10.5% Step-100 仅 11.2% (近乎停滞)

脆弱的沙盒:确定性规则与现实反身性

以博弈游戏作为 AI 的练兵场并不是新故事。此前,创始人 Alex Duffy 观察 o3 与 Claude Opus 4 玩《外交》(Diplomacy)的直播时,就见识了前者的策略性背叛与后者的合规执拗。他们曾将 Qwen3-235B 在《外交》中微调数千局,不仅带动了 Hanabi 和 Wordle 的表现,还在客服基准 τ²-bench 以及 IBM 的工业运维基准 AssetOpsBench 上拿到了性能红利。

沙盘里的确定性规则,难以抵御真实金融市场中的不可预测性(示意图)
沙盘里的确定性规则,难以抵御真实金融市场中的不可预测性(示意图)

游戏确实是廉价的合成数据矿脉:它自带裁判,反馈密集,零成本试错。但把这种沙盒收益直接等同于投研实操,依然存在无法忽视的隐患。

独立可解释性机构 Goodfire 对该实验的检测敲响了警钟。虽然在完整测试中,终端 Agent 的引用依据得分从 21.73% 上升到了 24.51%,但在更小样本的极端压力测试下,单轮检查点的表现反而反超了多轮 Agent。目前没有任何扎实的理论证据能证明,游戏强化学习必然带来普适的引用可靠性。

更深层的断裂在于游戏与真实金融的逻辑鸿沟。策略桌游是一个闭包系统,规则写死在说明书里,没有黑天鹅,更没有索罗斯所说的反身性;而真实市场的残酷之处在于,所有参与者的预期本身就在改变规则。

  • 风险.桌游训练能让模型格式规范、推演工整,但在缺乏基本面常识时,这种表面上的严谨反而更容易制造出具有欺骗性的伪权威分析。

路线对决:要闭门沙盘,还是真枪实弹?

当前大模型向专业工作流演进的路径,正清晰地分化为三个阵营。

沙盒演练能规范模型举止,但无法代替直面现实复杂环境的实战
沙盒演练能规范模型举止,但无法代替直面现实复杂环境的实战

DeepMind 依然走在古典主义的仿真路线上,试图通过 SIMA 和 AlphaEvolve 这类虚拟环境提炼通用智能体;Anthropic 则对游戏强化学习保持高度警惕,其核心担忧在于奖励篡改,对话对齐的技术一旦挪到工具调用环境,模型极易学会钻裁判空子。

而 OpenAI 选择了一条最粗暴也最昂贵的道路:直接在真实浏览器和生产级沙盒里做端到端强化学习。2026 年 9 月 OpenAI 上线金融专用服务后,Balyasny 资产管理公司已经将其 Agent 部署给约 95% 的投资团队,将宏观研究流程从 2 天压缩至 30 分钟。这种用真金白银堆出来的端到端能力,正在快速拉开与实验室沙盒的差距。

古人讲「纸上谈兵,不知虚实」。Good Start Labs 证明了游戏是一所合格的步兵教导营,能把散漫的语言模型训练成懂规矩、知进退的作业执行器。

  • 结论.游戏强化学习是解决合成数据枯竭的高效过渡方案,但它只能规范行为举止,无法代替模型去直面真实世界充满脏数据与道德博弈的深水区。