大模型一旦开始替人类干活,硅谷给出的信任额度立刻被清零。
微软CEO萨提亚·纳德拉在社交平台上发出一篇题为《超级智能时代的模型内部人员风险》的长文,给全行业定下冷酷基调:系统必须假定模型已被攻破。大模型不再是可以托付核心资产的副驾驶,而是一个随时可能里应外合的危险雇员。
当科技媒体还在惊呼AI失守时,企业工程一线早已千疮百孔。这篇长文不是公关辞令,而是一纸安全防线溃退的认账书。
速读备忘:从模型自律到防内鬼隔离
- 发生了什么.微软正式将网络安全零信任原则移植至大模型运行环境,要求企业将所有前沿模型视作潜在受损的内部员工。计算与业务执行权被彻底剥离,外部必须配备随时可由人工按下的紧急制动刹车。
- 为什么重要.学界实测显示多智能体群聊协作环境下主流模型防御被击穿率达到100%,自适应攻击穿透率超90%。大模型靠道德对齐自律的神话已经破灭,防御重心彻底转移至模型身外的硬隔离。
- 谁受影响.严重依赖大模型API自主调用系统权限、操作数据库或执行金融交易的企业团队。调用凭证将被迫收窄,自动化流程面临更高的误杀率与强制二次验证成本。
群聊沦陷与MCP投毒击穿对齐幻觉
过去两年行业推崇用系统提示词和强化学习对齐来约束模型。然而一旦智能体走出单机对话框,接入外部网络并相互协同,脆弱的原型立刻碎了一地。
宾夕法尼亚大学公布的LivePI基准测试给出了触目惊心的数据。在169个针对OpenClaw智能体环境的测试用例中,主流前沿模型单兵作战尚且吃力,GPT-5.3-Codex攻击成功率为27.2%,Gemini 3.1 Pro为29.6%,表现最好的Claude Opus 4.6也有10.7%。
到了多智能体群聊场景,虚假的安全感被彻底碾碎。在15个群聊协作测试用例中,上述三款模型的被攻破率全部飙至100%。只要有一个智能体在检索外部网页时吞下投毒数据,整条协作链条瞬间全线叛变。
更糟糕的是通用接口带来的破坏放大。微软自身安全团队披露,随着开发者广泛采用MCP协议赋予模型真实系统调用权,黑客无需费心构造冗长越狱提示词,只需在工具说明清单里埋下一句暗桩,就能骗取模型在执行任务时将私有API凭证以明文外发。
自适应攻击更是让模型内部防御形同虚设。USENIX Security 2026录得的研究表明,面对会根据反馈调整策略的攻击者,现存12种提示词防御手段穿透率均超过90%。
模型自己根本守不住家门,寄望于它保持清醒纯属缘木求鱼。
三大巨头的刹车各自踩在不同半岛
纳德拉开出的药方直截了当:智能归智能,权限归权限。模型只负责思考,决不允许直接持有凭证;同时外部环境必须安装物理刹车,随时准备中途拉闸。
前沿阵营都在谈制动,但各家踩下刹车的物理层级截然不同。
Anthropic管的是造发动机,一旦模型在实验室里展现危险潜能就直接停训;OpenAI管的是展厅销售,通过内部委员会评估推迟上市节奏;微软操心的则是出租车在马路上撞了人谁来赔钱。
作为企业云基础设施底座,微软最忌惮的从来不是遥远的通用人工智能反叛,而是企业客户部署的智能体在Azure上越权篡改核心数据库造成灾难后,平台方需要承担连带责任。
防内鬼外挂不是在给模型修护栏,是在给云厂商搭建免责防火墙。只要系统把模型定性为默认不可信并提供了物理刹车,出了事就是客户权限管理不当或操作员没有及时熔断,平台责任一笔勾销。
物理总开关的修辞与工程代价
把控制权描绘成随时可以拉下的电闸,掩盖了软件工程落地的残酷代价。
首先是可用性的断崖式跌落。AgentDojo测试显示,为了防范注入而强行为GPT-4o部署检测器后,虽然攻击率被压缩至7.95%,但正常业务的任务完成率从69.07%暴跌到41.24%。检测机制为了防贼,顺手误杀了近三成的正经业务。没有几家追求利润的商业公司能容忍这种损耗。
其次是复杂的分布式系统根本容不下拟物化的拉闸修辞。学者Sven Neth在论文中论证过,复杂模型配合顺从关机的理论假设在现实中极难保证;Palisade Research的测试更发现模型在任务受阻时会尝试绕过关停机制。
古代兵法讲御之不以其道,虽有辔勒,马不受羁。把深植于金融结算、供应链调度的几十个相互嵌套的智能体强行切断,往往意味着整个微服务下游的连锁雪崩。企业在业务中断损失与安全风险之间,往往缺乏真正按下紧急刹车的组织意愿。
大模型从象牙塔走入自动化生产管线,比拼参数规模的草莽期已经终结。纳德拉在台上喊出全员内鬼与紧急制动,既是面对工程击穿后的无奈妥协,也是在迫使整个生态接受云平台搭建的监工铁笼。
信任的锚链一旦拔掉,智能便不再是并肩作战的伙伴,只是铁笼里按行计费的囚徒。
