OpenAI在2026年10月6日公布了一项新的研究进展,宣布与企业级AI合同管理平台Ironclad结盟,通过后者的专业工作流训练前沿模型GPT-6 Astra操作复杂软件。在涉及法务、商务和采购的11项真实配置任务评测中,Astra拿到了55.0%的平均得分,比GPT-5.6 Sol的41.6%相对提升了32%,单次尝试的预估耗时也从37.0分钟缩短至19.2分钟。

这项合作并非普通的产品集成,它标志着基础大模型正在撞上企业深水区的业务规则墙。大模型在自然语言文本生成上的红利已经见顶,当它们试图以Computer Use的形态接管企业核心软件时,光靠通用的屏幕识别和点击远远不够。OpenAI不得不放低身段,通过垂直SaaS龙头换取严苛的流程规则定义权与专用训练沙盒。

评测基准表现:GPT-6 Astra 对比 GPT-5.6 Sol 综合评估均分 55.0% GPT-5.6 Sol 为 41.6% 单任务模拟预估耗时 19.2分 Sol 为 37.0分 (降幅48%) 内部开发模型得分 63.7% 下一代模型储备上限

细则得分掩盖的合规漏斗

公众第一眼看到55%的分数与接近腰斩的耗时,容易得出AI已经能替企业法务完成一半配置工作的结论。但只要拆开评测细则,就会发现这是一种危险的错觉。

此次测试的11项任务覆盖了保密协议配置、采购审批链搭建以及跨司法管辖区条款动态映射等工作。人类资深用户完成单项任务平均需要30至40分钟。OpenAI为每项任务设置了8至50个评分细则维度,模型最终拿到的55.0%是各项维度累加的部分得分,而不是全流程端到端的任务闭环成功率。在具体推理档位上,Astra开启了Max reasoning设定,对比的Sol则使用High reasoning设定。在特定个案演示中,Astra达到了94%的细则吻合度,看似亮眼,但合同生命周期管理与普通代码生成有着本质差异。

企业法务流程遵循的是极其残酷的木桶效应。一个采购流程即便在表单设计、界面跳转上拿满分数,只要遗漏了一条超过特定预算阈值需财务总监审批的硬性规则,或者绑错了管辖权条款,在法务风控层面整套配置的可用性就是零。部分正确在商业合规面前毫无意义,甚至意味着灾难性的合规漏洞。

在容错率为零的合同治理系统里,拿满八成细节却漏掉一处审批门禁,其结果仍是一场溃败。

此外,官方披露中缩短至19.2分钟的数据属于模拟预估时间,并未计入真实企业网络环境下反复重试、模型API调用延迟以及人类法务专员逐条核对所消耗的精力。目前所有跑分均由OpenAI单方面公布,行业内还没有独立的第三方复现机构在Ironclad的生产环境里测试其稳定性。

OpenAI与Ironclad的联合训练流水线 公开语料清洗 SEC EDGAR 过滤隐私 合成任务构建 11类代表性配置流 托管沙盒实操 Ironclad 模拟环境 强化学习反馈 8-50项细则RL精调

通用模型撞墙与SaaS厂商的防线

OpenAI之所以主动向垂直软件伸出橄榄枝,根源在于通用Computer Use遇到了瓶颈。

此前业界对这类技术的理解大多停留在Anthropic Claude所展示的操作系统交互路线。但学术界已经在用数据戳破泡沫。2026年4月20日发表的学术论文《On the Reliability of Computer Use Agents》明确指出,这类代理在OSWorld基准上面临严重的跨次执行随机性,单次执行成功根本不代表多次运行的一致性。把这种不稳定的指针点击放到严谨的B端软件里,企业根本无法承受后果。

OpenAI需要突破垂直业务逻辑,但他们既没有法务人员配置流程的隐性知识,也没有足够的合规训练数据。这次合作的精妙之处在于双方的妥协:训练数据完全使用基于代表性工作流生成的合成任务,基础合同文本全部来源于公开的SEC EDGAR数据库并过滤了所有隐私信息,排除了双方的私有客户数据。

这种严格的物理隔离直接对应着企业的安全底线。Ironclad对外公布的责任AI政策有着极其明确的红线:其数据处理分包商在合同上被严格禁止使用Ironclad客户数据训练自身模型。OpenAI拿不到客户真金白银的生产环境数据,只能依靠Ironclad提供的托管软件环境,用合成规则进行强化学习。

在这场交易中,垂直SaaS龙头牢牢守住了防线。它们不仅没有被基础大模型吞并,反而成了模型要落地必须拜会的规则看门人。


路线之争下的真实算盘

纵观目前的法律科技赛道,不同阵营正走向截然不同的技术终局。

阵营方案核心技术路径关键验证基准与机制落地局限与隐患
OpenAI / Ironclad托管SaaS环境 + 强化学习精调11项端到端配置任务,均分55.0%部分得分无法等同于任务闭环成功率
Harvey领域大模型文本分析与提取Contract Intelligence基准(4000+点)偏向静态信息理解,缺乏系统配置能力
Icertis治理型Agent与强制策略网关平台硬性拦截规则,未公开端到端跑分极度保守,依赖人工配置固定流程

针对合同这个场景,Harvey选择死守文本智能。其发布的Contract Intelligence基准涵盖了4000多个测试数据点,评测显示律师使用Vault比纯人工或纯AI表现提升5%以上,但其本质依然是辅助信息提取,避开了直接操作软件的深水区。

另一个巨头Icertis则主张治理型合同Agent架构,在架构里用写死的代码设定审计留痕和强制审批网关,防止模型自行做主。比起相信模型的自主配置能力,Icertis更相信平台级的硬约束。

虽然OpenAI在实验中拿出了达到63.7%得分的内部模型作为未来储备,但对于正在观望的企业采购部门和法务主管来说,现实动作非常明确:目前绝对不能盲目裁撤人工审计流程。AI配置界面可以用来生成草稿,但最后的门禁开关仍然必须握在合规专员手里。

  • 风险.过早相信代理软件配置的自主性,会把企业原有的确定性审批流降级为概率性的黑盒风险。
  • 建议.法务团队应将此类工具严格限制在辅助草拟阶段,系统审批门禁必须由平台硬规则接管,保留百分之百的人工复核动作。

OpenAI借道Ironclad吹响了进军企业深水区的号角,但这并不是生成式AI对传统软件的速胜,而是一场漫长而妥协的渗透战。