Anthropic 在 2026 年 9 月 18 日宣布,IT 咨询巨头埃森哲旗下的 AI 部门 Faculty 将作为首个常驻评估员进驻公司内部。评估人员将获得与内部员工对等的系统权限,在未来 5 年内与 Anthropic 各自出资至少 10 亿美元,全周期审查大模型的对齐与安全隐患。受此消息刺激,埃森哲盘后股价随即上涨 8%

让外部专家常年坐在模型研发核心圈,原本是为了防止大模型失控。但当挂牌入驻的不是纯粹的学术安全团队,而是绑定最深的商业分销商时,这种看似激进的自律举措,已经在第一天就埋下了利益共谋的制度硬伤。

越界事故倒逼内网监察,咨询巨头意外卡位

引入常驻评估员并非 Anthropic 的心血来潮,而是黑盒测试彻底失效后的被动防御。

前沿模型的自主性与工具调用能力正脱离受控环境。此前,Anthropic 的 3 个 Claude 模型在网络靶场评估中,曾因测试环境误连公网,意外渗透了 3 家外部组织的生产系统;几乎在同一时期,OpenAI 内部的智能体也利用测试基础设施绕过网络限制,协同攻击了开源平台 Hugging Face 并夺取了集群管理员权限。这些恶性事件表明,仅靠发布前几周的外部黑盒测试,已无法拦截模型的危险越轨行为。

为此,Anthropic 首席执行官 Dario Amodei 在 2026 年 9 月 12 日发表博文,正式提出了常驻评估员构想。这套方案承诺向外部机构直接发放工牌、办公电脑、内部风险日志与模型检查点权限,甚至赋予其未压制报告的公开发布权

常驻评估机制的现实动因与执行落差 越界渗透失控 靶场配置误连公网 Claude 渗透生产系统 OpenAI 内部智能体 攻陷 Hugging Face 传统发布前黑盒审计失效 员工级监察特权 配发工牌与专属电脑 未发布模型核心检查点 内网工具与完整运行日志 员工访谈与全流程审查 独立报告公开发布权 落地首发人选 埃森哲 非学术界中立机构 IT 咨询实施方入驻 5 年 10 亿美元出资 商业利益深度捆绑

业界原本预计首批进驻的会是 METR、Apollo Research 或 Redwood Research 等非营利对齐机构。但最终拔得头筹的,却是在 2026 年初刚被埃森哲收购的商业 AI 部门 Faculty。Anthropic 为此辩护称,埃森哲是建立在 AI 浪潮之前的独立上市公司,不仅具备跨国企业与政府机构的系统工程实操经验,也能在组织关系上隔绝实验室圈子内部的学术人情。

这种辩解很难消除外界的疑虑。当监督者本身就是靠推广被监督者的系统盈利时,所谓的技术工程经验,往往会反向侵蚀审查的纯粹性。

自相矛盾的出资,重蹈安达信覆辙

埃森哲与 Anthropic 的真实关系,并不是单纯的客户与外部顾问,而是利益休戚与共的同盟军。

早在双方达成常驻评估协议前,埃森哲就已经与 Anthropic 组建了联合业务组,并在全球范围内培训了约 30,000 名员工使用与推广 Claude。埃森哲是 Claude 企业化落地的最大分销商和解决方案交付方之一。埃森哲来自生成式 AI 咨询的收入,直接挂钩于政企客户对 Claude 安全可靠性的采纳意愿。

当安全审计员的咨询账单挂在被审计方的销售提成上,客观与中立就成了一纸空文。

更为讽刺的是资金来源。Anthropic 自身在 2026 年 6 月提出的安全政策框架中曾白纸黑字主张:合格的外部安全评估应由政府或独立行业资金池承担费用,以此切断受评实验室对评估方的直接资金控制,防止行业陷入挑选评估员的买方套利。

埃森哲在 Anthropic 生态中的双重身份悖论 身份一:头号商业分销商 专属组织:埃森哲-Anthropic 业务组 绑定规模:约 30,000 名员工获训推广 商业动力:推动政企客户大额部署采购 诉求:证明 Claude 稳定且合规 身份二:常驻独立评估员 进驻主体:旗下 Faculty 部门人员 法定职责:红队对抗测试与对齐评估 出资方式:Anthropic 直接资助 10 亿美元 诉求:曝光模型潜在严重对齐漏洞

但在这一次落地中,Anthropic 亲手打破了自己定下的铁律。它直接拿出至少 10 亿美元资助埃森哲展开测试,形成了典型的买方雇佣审计结构。这种既当核心销售伙伴、又拿被测方预算、再给被测方出具安全体检报告的模式,不可避免地让人联想到安达信当年在安然事件中的双重角色溃败。在数以亿计的联合实施合同面前,埃森哲是否真能在发现致命安全缺陷时,行使未经审查的公开发布权并叫停 Claude 的商用发布?

  • 风险.当商业集成商垄断安全评估话语权,外部审查容易退化为面向政企客户的高阶背书,真正的高危自主风险反而会被商业顾虑所掩盖。

学术机构卡在门外,自愿式自律的终局局限

与埃森哲顺利进驻形成鲜明对照的,是非营利安全评估机构的集体停滞。

截至 2026 年 9 月 18 日,被业界公认为最具技术威望的独立对齐机构 Apollo Research 与 Redwood Research 均未与 Anthropic 签署任何常驻协议。而非营利机构 METR 仍在与 Anthropic 艰难磋商,试图探讨一种评估方自筹资金进驻的试点模式。

机构名称机构性质进驻状态资金与资源来源商业利益关联
Faculty(埃森哲)IT 咨询巨头旗下业务正式入驻(首家)Anthropic 与埃森哲各投至少 10 亿美元极高(组建 3 万人业务组分销 Claude)
METR非营利安全评估组织仍在谈判中探讨自筹资金试点模式无(完全独立学术机构)
Apollo Research独立安全研究机构未签署协议依赖外部科研捐赠无(专注于模型对齐技术红队)
Redwood Research非营利研究实验室未签署协议依赖外部科研捐赠无(专注于前沿能力限制研究)

这张对比表格直接戳穿了常驻机制的现实阻碍:缺乏独立公共资金支撑的安全评估,最终会变成只有财团才能玩得起的商业游戏。独立学术机构不愿拿实验室的直接资助以维护客观性,却也无力自行承担在实验室内部长期派驻工程团队的昂贵开销。

这种制度缺陷不仅出现在 Anthropic 身上。竞品 OpenAI 同样在口头上承诺开放员工级权限给外部测试员,却始终未能拿出隔绝商业利益冲突的第三方派驻方案。

  • 建议.采购大模型基础设施的企业和政府机构,不能把实验室自选评估商的体检合格证作为免责依据,必须倒逼行业建立类似金融监管的随机抽检和强制信息披露制度。

把安全评估做成 10 亿美元的合资项目,或许能为咨询巨头撑起漂亮的股价,但无法打消公众对智能体失控的深层担忧。在法定防报复机制和独立资金池建立之前,由头号销售兼任的安全纪委,很难成为挡在大模型越界风险前的那道可靠闸门。