OpenAI 正式发布面向法律行业的垂直基础设施 Astra for Law。官方公关稿里最抓人眼球的数字,是其在 Vals AI 法律检索基准测试中拿到了 40% 的相对性能提升。但剥离营销话术后会发现,这项测试的端到端综合正确率只有 54.0%。
在判例稍有差池就会招致惩罚性赔偿的法律实务里,刚过及格线的正确率意味着近一半的检索结果依然无法直接采信。
跑分拆解:参照系里的障眼法
这款新方案基于 GPT-6 Astra 底模,官方打包了覆盖超 2.3 亿个 URL 的法律搜索索引,并与非营利机构 Free Law Project 合作,吸纳了 CourtListener 旗下涵盖超 99.9% 美国先例判例法的数据,以 API 端 gpt-6-astra-law 的形式分发。

官方大篇幅展示了性能跃升:相比纯网页检索版本的 GPT-6 Astra(38.7% 正确率),新模型带来了 40% 的相对提升,引用参考案例增加了 24%,审计目标段落召回率提高 54%。在与 Legora 合作的财报核对流程中,效率提升近 40%,并成功检出了全部 4 处人为植入的错误。
但这套看似耀眼的跑分,存在着精心挑选的参照系。
这项测试使用的是 Vals AI 的私有验证集,而不是公开排行的基准集,没有任何横向对比能证明其超越了汤森路透的 CoCounsel Legal 或是垂直独角兽 Harvey。所谓的 40% 飞跃,仅仅是它与自己未装配专有索引的通用底模比试得出的结论。
另一个被巧妙置换的概念是幻觉。OpenAI 在宣传中给出了 4.2% 的内部测试幻觉率,但这仅针对模型自我能力声明的误导倾向,完全不是指法理推演和判例引注的无误。来自学术界的独立测试显示,即便是成熟的专业法律检索增强生成工具,真实应用中的幻觉率也普遍落在 17% 至 33% 之间,整体最高准确率仅为 65%。
宣称的相对跃升掩盖了绝对短板,刚过半数的及格成绩无法充当法律护城河。
闭环断层与引注高墙
将考核尺度从单项检索切到复杂的端到端实务,模型能力立刻出现断崖式下跌。在第三方法律基准测试中,Astra 面对单项合同评估标准能够拿到 87.1% 的符合率,但一旦要求其完整交付整套合同工作流,端到端通过率仅有 25.8%。而在针对复杂法律研究的 DELTA 测试中,其标准符合率尚有 67.7%,实际端到端任务通过率暴跌至 6.7%。

这意味着,它在单点问答上像个背诵法条的优等生,但真要接手连续推进的法律案头,链条随时可能断裂。
更本质的屏障在于司法编纂深度。OpenAI 接入了 CourtListener 的海量判例,但公开诉讼记录从来不等于权威法理体系。传统巨头汤森路透与 LexisNexis 构筑的核心壁垒,不是原始文本的多寡,而是 KeyCite 或 Shepard's 这类耗费数十年人工编纂的判例效力追踪系统。
一个判例在当下是否仍是有效法,是否已被上诉法院隐性推翻或限缩解释,单纯靠抓取公共文本很难精准判断。连提供数据的 Free Law Project 官方都给出了防御性声明:模型客户端在转述过程中极易产生摘要失真与断章取义,公共案卷本身更充斥着敏感隐私与司法系统偏差。
- 风险.缺少 KeyCite 级别动态效力标注的文本库,无法在严肃诉讼对抗中为律所提供合规抗辩底气。
插件侵入与生态暗礁
如果说能力边界尚可等待迭代,那么 Astra for Law 对产业上下游格局的冲击则更为直接。OpenAI 同步推出了 26 个生态插件,涵盖 Clio、Relativity、iManage 等成熟系统。

表面上看,OpenAI 强调自身是赋能 Harvey、Legora 等上层软件的供应商。但底层模型一旦自带垂直法律检索索引,并直接集成几十个主流工具插件,它事实上就踏足了此前垂类 SaaS 赖以生存的核心领地。
| 参与方 | 核心资产与举措 | 真实处境与博弈 |
|---|---|---|
| OpenAI | GPT-6 底模 + 2.3亿 URL 索引 + 26 个插件 | 下沉至垂直基础设施,侵蚀应用层溢价 |
| 垂直 SaaS (Harvey / Legora) | 专有工作流 + 律所定制私有微调 | 护城河变薄,被迫加速绑定更深私有数据 |
| 传统巨头 (Thomson Reuters) | 专有版权 + KeyCite 权威编纂体系 | 短期防守稳固,长期借插件接入保持卡位 |
| 大型律所 | 专有办案先例与合规风控边界 | 享有采购议价权,但承担终极伦理审查责任 |
在技术层,另一个更严峻的现实正在浮现。OpenAI 在安全评估中披露,Astra 的思维链与书面推理过程相比前代更难被审计与监控。
尽管 OpenAI 与 Latham & Watkins 联手打造了权限架构,并为律所提供了零数据留存承诺,但免责条款的核心没有改变:模型给出的所有意见,最终法律责任依然百分之百由签字的人类律师承担。
- 建议.律所与法务团队采购此类工具时,应将其定位为初级案头检索加速器,严禁跳过人工交叉复核进入交付环节。
天下熙熙,皆为利来。OpenAI 并不满足于充当通用的算力管道,它正试图借行业基座之名,切分专业软件市场最丰厚的一块利润。然而,法律从来不是仅靠概率连接词句的生成游戏。当推演链路日渐黑箱、判例引注缺少权威锚点,律所采购部门在短暂的效率狂欢后,依然要退回最保守的防线:谁能签字,谁来担责。
