用一句只有七个英文单词的提示词,让 AI 一键交付一个能玩的游戏,听起来像是典型的营销演示。2026 年 9 月,开发者在 Hacker News 上放出的测试项目 Pac-Bench,就给各家主流大模型与编程编排环境布置了同一道极简考题:在单一 HTML 页面内写出一个吃豆人游戏,全程不允许任何人工干预或追问修复。结果并非皆大欢喜的生成式狂欢,而是一张落差巨大的梯队清单,Claude Opus 5.5 搭配 Claude Code 脚手架拿下 99 分 拔得头筹,而不少名声在外的辅助工具直接跌到了 34 分 的不及格线。

需要说明的是,学术界另有测试机器人操控的 PAC Bench 以及衡量隐私代理的同名基准,本文讨论的则是针对单页代码生成的吃豆人专用测试。这套基准之所以引人注目,在于它撕掉了静态代码高亮与截图的遮羞布,让模型直接面对带状态机的运行时环境。

90 秒自动化实测,照出隐性工程暗坑

许多代码生成评测习惯静态比对语法树或依靠单元测试,但游戏开发属于典型的即时交互系统。Pac-Bench 在 2026 年 9 月 28 日对各模型生成的单文件进行了实操运行,通过 90 秒 自动化试玩与源码审计,将总分 100 分拆解为五个严格维度:控制响应占 20 分、幽灵逻辑占 25 分、防卡死机制占 20 分、迷宫寻路占 20 分,以及音效合成占 15 分。

Pac-Bench 综合表现阶梯分布 Claude Opus 5.5 (Claude Code) 99 GPT-5.6 Sol (Codex) 90 DeepSeek V4.1 Flash (OpenRouter) 72 Gemini 3.7 Flash (Antigravity) 38 Cursor Auto (Cursor Cloud) 34

拿到 99 分的方案不仅写出了毫无破损的对称迷宫,还精准复刻了原版街机的四种幽灵巡逻与追逐算法,并用 Web Audio API 合成了双乐句开场旋律与底噪渐进音效。但只要往下扫视榜单,各类看似不可思议的工程暗坑便密集浮现。

Grok 4.6 生成的代码在普通刷新率下表现尚可,但在 ≥165 Hz 的电竞高刷屏下,物理帧循环因缺乏时间步长解耦而彻底锁死,幽灵全部原地冻结;GLM-5.3 Flash 拿下了 88 分,却因为在无用户交互手势时预先初始化 AudioContext,导致页面在 Safari 浏览器中完全静音;至于仅得 38 分的 Gemini 3.7 Flash 与 34 分的 Cursor Auto,不仅幽灵寻路逻辑彻底崩塌,甚至出现了角色穿墙逃逸出地图边界的低级逻辑脱轨。

  • 提醒.纯前台自动化代码如果忽略浏览器宿主策略与高刷帧率适配,静态通过率再高也无法掩盖运行时的崩溃。

效费比账本背后的代际倒挂

除了能不能跑通,商业应用中最关键的变量是计算开销与交付速度。本次基准公开了详细的耗时与成本估算,虽然其统计口径存在外部差异,例如 OpenAI 基于官方费率推算,Cursor 直接读取扣费账单,而跨平台的 token 统计标准也不完全统一,但数字之间的悬殊差距依然极具穿透力。

生成效费比极端对照 GPT-5.6 Sol (Codex 90分) $0.72 / 耗时 4m 55s 输出 2.1万 tokens,极速闭环 Claude Fable 5 (Claude Code 95分) $17.28 / 耗时 37m 01s 输出 16.1万 tokens,陷入长考重试

拿到 99 分的 Claude Opus 5.5 花费了 1.99 美元,耗时 9 分 17 秒,其输出的 6.1 万个 token 中有超过 3.6 万 个用于后台思考。相比之下,GPT-5.6 Sol 仅用时 4 分 55 秒、花费 0.72 美元 便拿下了 90 分,展示出极高的推理收敛效率。而同样拿到 95 分的 Claude Fable 5 却在长考与工具调用中消耗了 16.1 万个 token,耗时超过 37 分钟,账单飙升到 17.28 美元。为追逐最后 5% 的细节还原,调用成本飙升了 24 倍。

更耐人寻味的是代际倒挂现象。在相同的 Codex 编排环境下,标号更新的 GPT-6 Astra 仅得 87 分,GPT-6 Sol 获得 83 分,双双落后于前代 GPT-5.6 Sol 的 90 分。新一代模型在处理高度压缩的单文件长逻辑时,反而可能因为过度泛化或注意力发散,在边界碰撞与幽灵状态跳转上出现倒退。


是真工程能力,还是语料背诵与脚手架红利?

该测试在 Hacker News 引发了 38 次点赞与 23 条高强度讨论,社区的审视目光很快从模型跑分转向了测试方法本身。

极简需求测出的往往不是工程实现,而是模型对未言明假设的逆向猜谜。

开发者最核心的质疑在于两点。其一,吃豆人在软件工程史上拥有极其庞大的开源实现和拆解教程,语料污染率极高。模型能够端出 10 KB 的高质量实现,很大程度上取决于它能否从海量预训练权重中唤醒特定代码模式的记忆碎片,这与在真实企业环境中编写缺乏历史参照的业务系统不可同日而语。

被绑架的评测链路:模型能力与外部变量 模糊需求输入 一句话极简提示词 Harness 编排脚手架 上下文压缩 / 重试循环 严重干扰纯模型能力对比 端到端代码交付 90秒运行验收与评分

其二,测试深度混淆了模型本体智能与外部编排环境(Harness)。榜单中的参与者并非站在同一起跑线上,有的直接由 Claude Code 接管,拥有多轮自我审查、终端模拟与上下文重写机制;有的则运行在 Cursor Cloud 或原生 Codex API 上。Cursor Auto 的低分并不完全等同于其底层基础模型的失效,而很可能是其脚手架针对单文件巨石代码的自循环设计存在短板。

  • 结论.将来的自动编程基准必须解耦编排容器与基础模型,否则开发者花高价买来的可能只是脚手架的无效循环,而非真正的逻辑推理。