法律科技公司Legora这几天放出一个客户案例:用OpenAI刚发布的GPT-6 Astra模型跑了一次财务报表核对,41份文件,几分钟跑完,人为埋进账目里的4个错误全部揪出来,其中一笔藏在收入附注里的50万英镑缺口也没漏过。这本是律所和会计所最耗人力的活——把草案账目、试算表、合并调整表和上年账目逐项对齐,传统做法要耗掉一整晚甚至几天。
案例标题打的是这次提升"近40%"。但把Legora自己公布的另一组数字摆在一起看,故事就没那么简单:同一个模型,在Legora自研的全任务基准BAR上,平均提升只有约3%。一个是接近四成,一个是不到零点零三,中间差了十几倍。
41份文件核对完,数字对上了
这次的活叫"tie-out",财务和法律尽调里最机械也最容易出人命的一环:任何一个数字对不齐,都要人工逐条排查根源。Legora的法律工程师说这种活"能占掉一整个晚上,有时候几天"。
GPT-6 Astra把41份文件的每一笔余额都对照支持性附表检查了一遍,标出差异,并把每一次核对都记录下来——相当于把审计师最不愿意干的体力活先扫一遍。它不仅找出全部4个植入错误,还比前一代模型多完成了大约50项额外核对,并且保留了前代原本就做对的所有检查项。这是一次"没有漏项也没有回退"的升级,单看这个场景,确实漂亮。
近40%和3%,同一张成绩单上的两个数字
问题是,这40%从哪来。它是财务报表核对这一个具体工作流的相对提升,而不是模型整体推理能力的跃升。Legora用来评估模型的BAR基准覆盖了更广的法律任务,GPT-6 Astra在那上面平均只涨了3%左右。
更值得留意的是,BAR是Legora自己设计、自己跑的基准,没有第三方复核。评测方和被评测的模型厂商,商业利益是绑在一起的——Legora需要案例证明产品迭代有效,OpenAI需要客户故事支撑新模型发布。这不代表数字造假,但意味着"近40%"经不起独立复现的检验,更像是从多个场景里挑出来的一个最佳答卷。
那4个错误也是Legora自己埋进去的,答案早就知道。真实审计里错误从哪冒出来、分布多分散,谁都说不准,模型在"已知题库"里全对,不等于在未知错误面前同样不漏。
案例研究是厂商的选美大赛,3%才是及格线,40%只是那天穿了礼服。
律所算的是另一笔账
Legora服务超过10万名专业人士、1800多家律所和法务部门,现在正把这套东西往审计、税务、合规延伸。对律所合伙人来说,这类工具最直接的诱惑是省时间:一晚上的核对活压缩到几分钟,意味着能接更多项目,或者用更少的初级人手做同样的工作量。
- 风险.tie-out这类按小时计费的基础工作被压缩,首先受影响的是靠这类活攒经验的初级律师和审计助理,他们的入门岗位可能先被削减。
"人在回路"的说法——模型做核对,专业判断留给人——听起来稳妥,但没回答一个更现实的问题:当机器把一晚上的活干成几分钟,律所按小时收费的商业模式怎么调整,初级岗位的成长路径要不要重新设计。这些才是案例研究之外,真正决定这项技术落地速度的变量。
接下来值得盯的是三件事:有没有独立机构复现BAR基准的结果,Legora向审计和合规领域扩张后准确率是否维持同一水平,以及Harvey、Robin AI这些同类竞品在相同场景下的表现——目前这些对照全部缺失,案例研究给出的只是一个方向,不是答案。
