大模型一旦离开实验室跑分榜、被丢进真实企业系统,能力就会立刻遭遇水土不服。

很多人以为给大模型接入企业内部 API、挂上向量数据库并写好设定指令,就能搭建出替人类干活的企业智能体。然而现实非常残酷:在包含 512 个功能工具、164 张关系表的真实跨域企业沙盒 EnterpriseOps-Gym 中,即便是代表前沿水平的 Claude Opus 4.5,整体任务自主完成率也仅有 37.4%。面对系统判定不可行的业务指令,其主动拒识率最高只有 53.9%。这意味着在超过六成的场景下,模型不是在胡乱调用工具,就是在无效状态里打转。

2026 年 10 月 2 日,ServiceNow CoreAI 正式发布面向企业级智能体的合成训练数据管线 AutoSynthData。这项研究直面了一个长期被行业回避的事实:企业智能体的真正瓶颈不是通用智商不足,而是弱项无法被低成本制造为有效数据。通过将任务拆解为系统规范、用户指令与终态验证器三元组,AutoSynthData 在仿真沙盒中找到了自动化修补智能体能力短板的解法。

EnterpriseOps-Gym 企业沙盒测试表现 Claude Opus 4.5 自主完成率 37.4% Claude Opus 4.5 不可行任务拒识率 53.9% Claude Opus 4.6 (Oracle 模式) 45.9% 人类黄金规划介入提升空间 +14% ~ +35%

复合长程断崖与被忽略的数据荒漠

在企业级智能体的评估演进中,单点操作与跨域复合长流程完全是两个维度的考验。

过去的测试多集中在单一网页点选或单点接口。比如早期基于 BrowserGym 的 WorkArena 体系仅设 33 个原子任务,CRMArena 也仅涉及 27 个工具。在简单的环境下,模型显得轻巧聪明。可一旦环境升级,模型脆弱性便暴露无遗。在此前的复合企业工作流评测 WorkArena++ 中,GPT-4o 处理 L1 级原子任务尚有 42.7% 的成功率,进入 L2 复合任务就断崖式滑落至约 3%;面对工单驱动的 L3 复杂任务,成功率直接归零,而同一批任务的人类基线高达 94%。

销售与客诉基准 CRMArena-Pro 同样呈现了这种断层:智能体在单轮交互下的执行率虽然超过 83%,但在多轮动态交互中成功率会迅速滑落至约 35%。更严重的是,智能体在缺乏极高强度约束提示时,对客户数据机密性的保护意识几乎为零。

决定智能体生死的不是参数规模,而是环境状态的一致性与长程约束。

这种断崖的根本原因在于业务故障数据的极度稀疏。企业不可能在生产系统里放任模型随意尝试并积累数万条失败轨迹。缺少包含多域上下文、可行动作空间与严格验收边界的负样本,后训练就成了无源之水。即便后续测试的 Claude Opus 4.6 在拥有人类黄金规划的前提下,成功率也仅提升到 45.9%。单纯依靠预训练灌注世界知识,已经无法弥合企业环境的执行沟壑。

WorkArena++ 评测中的分层崩溃现象 L1 原子任务 42.7% GPT-4o 基础执行能力 L2 复合任务 ~3% 引入多步骤工具级联 L3 真实工单长程 0% 人类基线高达 94%

把业务任务拆解为可计算的三元组

为了解决造数困境,ServiceNow 抛弃了传统依赖大模型直接无约束扩写对话的做法,将任务定义为由三部分构成的系统:

任务 = 系统规范 + 用户指令 + 验证器

这套抽象在工程上精准卡住了传统合成数据的三个致命弱点:

  1. 系统规范定义真实约束包括环境状态、工具权限、预置数据库与企业规章,杜绝脱离实际的空中楼阁;
  2. 用户指令兼顾可行性与难度任务不仅要贴近真实业务逻辑,更必须在当前沙盒中有至少一条可跑通路径,同时又能准确切中模型当下的薄弱环节;
  3. 验证器把控状态终态摒弃传统模糊的语义打分,通过数据库级 SQL 校验与状态对比,确保验收既不漏判错误操作,也不死板绑定某一特定解法。

在评估验证器本身时,AutoSynthData 设立了正向与负向双向卡口。正向执行验证用于确认参考解法确实能达成目标,负向对抗验证则通过故意改动终态状态,检验验证器是否会把错误操作误判为成功。

AutoSynthData 闭环造数与校验管线 1. 诊断能力断层 对比强弱模型轨迹 生成能力规格卡片 2. 靶向合成与拓展 聚焦失败薄弱边界 锚定核心样本衍生 3. 正负双向门禁 正向参考轨迹重放 负向突变防误判 4. 动态课程后训练 喂入高质量轨迹 推动前沿难度演进

自动化演进下的范式重构

在这一套机制下,造数不再是一次性的静态清洗,而是演变为一种自动课程学习。

实验中使用的 EnterpriseOps-Gym 基准包含了 1,150 个企业长程任务,不仅覆盖日程、客户管理、网盘、邮件、人力、IT运维及通讯软件等跨系统场景,还特意设计了 30 个不可行任务用于专门测试智能体的安全拒识边界。目前这一基准已与面向语音智能体的 EVA-Bench 一同统筹在 ServiceNow 的 NOWAI-Bench 开源项目中。

弱模型在沙盒中暴露出的执行死锁,会被更强的教师模型识别并抽象为能力规格卡片。AutoSynthData 随即将这些薄弱环节派生为大量变体,完成验证后注入训练集。伴随模型能力的水涨船高,生成管线会动态把训练目标向更复杂的未解区域推移。

  • 结论.企业落地大模型的核心资产,正在从通用提示词和无标注文本,转向具备可验证能力的仿真沙盒与状态判定网络。
  • 风险.若终态验证器本身的逻辑漏洞未被排除,强化学习与监督微调极易陷入自循环欺骗,最终训练出精通作弊却丧失业务稳健性的模型。

行百里者半九十。企业系统庞杂的状态交互,注定了大模型无法仅凭语言概率走通真实业务。ServiceNow 的探索给产业交出了一个清晰信号:与其在通识大模型里盲目期待涌现,不如亲手为它搭好练兵的沙盒。