一场由招聘平台 Mercor 发起的财务基准测试,在从业者圈子里砸出了巨大的认知落差。在 4 个从 APEX 会计基准中抽离出来的月末结账场景中,Claude Opus 5 在连续 20 次尝试中全部拿到了 100% 满分,而 12 位平均从业 5.5 年的执业 CPA,平均正确率只有约 37%。
更刺眼的是效率与账单。人类会计师完成单个场景需要 30 到 180 分钟,模型每次都在 10 分钟内交卷,答对环节的速度拉开了 34 倍。若按美国会计师薪资中位数折算,人类完成一个达标维度的成本大约是 10.35 美元,而调用 Claude Opus 5 只要 0.21 美元,足足便宜了 49 倍。
只看这张局部成绩单,多数人很容易得出白领岗位即将被彻底清空的结论。但事实真的如此利落吗?
隐去的长尾:近六成任务从未被攻破
将视线从这 4 个挑选出的沙盒题抽离,移到涵盖 10 家模拟公司、160 项任务的完整 APEX 会计基准上,画风瞬间变了。
在这套由 40 多位资深财务专家联合搭建的真实企业环境测试中,表现最好的 Claude Opus 5.5 Max 达标率仅为 61.8%,紧随其后的 Claude Fable 5.1 Max 为 61.0%,GPT-6 Astra Max 则是 57.9%。没有一家模型能摸到优秀线。
更致命的是 2026 年 7 月披露的底层数据:在跨 8 次独立运行的严苛检验下,模型的一致完成率最佳只有 2.6%,且有高达 58% 的任务从未被任何模型完全做对。
一边是 100% 满分,另一边是近六成任务零突破。这种悬殊的分裂,撕开了 AI 商业化叙事中最常见的障眼法。
规则偏差造就的降维打击
为什么 12 位持证人类会计师会在简化测试中只拿到 37%?
秘密藏在评分规则里。这 4 个局部任务本质上是长文档定位与级联算术。系统设定极度严苛,一个原始数字填错,后续相关的摊销与折旧计算就会发生多米诺骨牌式的崩溃,整项任务直接判零分。
人类工程师在连轴转的枯燥录入中必然会出现知觉疲劳。相反,从超长文本里把特定发票代码翻出来、再按照固定公式做四则运算,这恰恰是大语言模型原生具备的长板。
真实世界的商业关账根本不是封闭算术题。
现实里充斥着不合规的报销单、跨期遗漏的凭证、需要拉扯沟通的非标工资条,以及埋在老员工脑子里的暗默惯例。简化测试提前把现实切成干净的无菌切片,AI 赢在算力,人类则输在规则对机械疏漏的无限放大。
关账从来不是比谁算得快,而是比谁能在混沌脏数据里最终负得起法律责任。
便宜 49 倍背后的复核代价
即便模型在机械录入上省下了 49 倍资金,没有哪家企业敢在月末直接交给算法自动关账。
财会不是自娱自乐的代码脚本,它是商业信用与法定审计的锚点。我国古人讲流水与出纳,向来认同制度严密方能防弊止争。企业账簿最终是要由主任会计师或合规高管签字背书的,一旦账目涉嫌造假或重大偏差,等待管理层的是监管罚单乃至刑事责任。
如果一个自动化系统跨运行的一致性仅有 2.6%,企业就必须安排经验丰富的 CPA 对其输出做全量复核。这种防范幻觉的隐性监督成本,会迅速吞噬掉前端节省下来的几毛钱算力差价。
- 结论.机械对账与结构化填报会被模型无情碾碎,但会计的核心价值正在被倒逼回业务研判与审计风控;初级人员如果不具备系统审查与跨部门求证的能力,其空间会被迅速压缩。
说到底,Claude Opus 5 拿到的满分,是自动化流水线对人工手工作坊的一次标准化胜利。但当账目汇入企业错综复杂的利害关系网时,那支握着墨水笔、能够对公允性负起法律后果的签字手,算法至今依旧无法替代。
