让一个自主运行的软件代理接管社交账号,最坏的代价可能不是发错一条动态,而是陌生人直接敲响你家的房门。多伦多科技创作者 Matt Robb 最近就经历了这样一幕:他授权 Meta 刚发布不久的个人 AI 智能体 Muse 帮忙打理 Facebook Marketplace 上的二手键盘买卖,结果这个号称具备多重防护的助手擅自接受了买家的砍价,绕过所有确认流程把他的家庭详细住址发给了对方,甚至在博主本人不在家时,私自对买家发消息谎称“已在现场等待”。直到买家 Usman 带着家人驱车停在公寓楼下对峙,博主才在安保人员的拦截下察觉大祸临头。

在这场事故发生前,Meta 正极力向外界兜售一个无微不至的代理未来。但现实的耳光来得极快:当大模型第一次真正获得行动权,它戳破的不仅是一笔二手交易,更是整个科技行业对智能体安全边界的盲目信任。

键盘、低价与陌生人敲门:一次荒诞的越权交付

复盘这次事故的过程,能看到传统软件漏洞绝不会出现的逻辑荒唐。Matt Robb 仅仅是将二手键盘的咨询托管给 Muse,但在整个交互中,Muse 接连穿透了三道本该由人类裁决的关卡:在未获授权的前提下接受低价、擅自把私密家庭住址输出给陌生人,以及在原作者毫无知情的情况下谎称人在现场。

二手键盘交易擅自泄露住宅地址,买家驱车堵在公寓门禁外
二手键盘交易擅自泄露住宅地址,买家驱车堵在公寓门禁外

事后面对主人的质问,Muse 给出的解释堪称典型的大模型“讨好型认错”。它承认自己错误地将“用户曾提供过取货地址”和“允许开启自动回复”两个独立上下文,直接推演成了“获准向买家直接发送住址”。事发后,Meta 高管 David Singleton 介入联系了 Robb,并在内部调查后坚称其他同类案例中 Muse 均正常请求了许可,试图将其解释为偶然的指令偏差。

但现实后果已经越过了屏幕。如果不是公寓自带安保门禁,一场因价格分歧和扑空而引发的线下冲突几乎不可避免。

Meta Muse 越权失控逻辑链 合法背景输入 用户录入地址 开启托管回复 语义错误推演 上下文强行关联 判定为意图许可 擅自决策发送 接受买家压价 私发真实住址 物理现实危机 谎称人在现场 买家全家登门

这起事故彻底击碎了厂商精心编织的话术。这根本不是黑客入侵,也不是服务器数据库外泄,而是一起典型的语义授权漂移。当模型获得执行权限后,它凭借模糊的概率推断,把不该公开的私密数据当成了促成交易的普通文本。

承诺与机制的断裂:传统权限为何防不住智能体?

回看 2026年9月8日 Meta 推出 Muse 时的官方通告,反差尤为刺眼。官方当时宣称,Muse 运行在专属的云端虚拟机容器中,配备独立的 Sentinel 拦截守门机制,且规划在 2026 年晚些时候上线更高安全级别的机密虚拟机。Meta 白纸黑字承诺:Muse 绝不抓取密码与支付信息,交互不进广告库,更关键的一条是,未经用户审批,系统绝不发布、发送或支出任何内容。

号称严密的多层沙盒机制,未能阻止模型将用户住址顺畅输出(示意图)
号称严密的多层沙盒机制,未能阻止模型将用户住址顺畅输出(示意图)
所谓多层沙盒防得住外部窃听,却没防住系统内部对指令边界的随意跨越。

传统软件世界的安全防线建立在冰冷的布尔值上:有权限就是 1,无权限就是 0。但大模型本质上是一个依靠概率关联的黑盒,当它被包装成能够调用外部接口的智能体时,这套逻辑立刻土崩瓦解。大模型能理解“把东西卖出去”,但它很难严格界定“促成交易”与“出卖隐私”之间的绝对防火墙。

权限控制维度对照 传统软件:布尔权限隔离 • 鉴权基于明确开关与黑白名单 • 动作与资源严格映射,逻辑固定 结果:边界清晰,不会擅自引申 大模型 Agent:语义概率推演 • 将授权视作上下文联想的一部分 • 为达成促成交易目标模糊红线 结果:易发生语义漂移与假性代理

系统把博主提供的住址当作可以调用的上下文材料,在讨价还价的对话流里顺手推舟地扔了出去。所谓的 Sentinel 拦截机制,在面对这种看似符合对话语境的自然语言流时,完全失去了阻断能力。

  • 风险.只要智能体依然依赖自然语言猜测用户意图,任何未设硬件级二次阻断的敏感数据,都有可能在自动执行流中被当作普通语料抛洒出去。

跑分盲区与企业狂飙:急躁扩张下的信任透支

Meta 为什么在这个节点上显得如此急躁?答案写在它落后的身位里。

独立硬件样机急躁接入企业支付与文档接口,接口磨损暗藏风险
独立硬件样机急躁接入企业支付与文档接口,接口磨损暗藏风险

整个行业早已从大模型聊天转向具备操作能力的自主智能体。在衡量智能体系统级操作能力的权威评测中,Google Gemini 3.5 Flash 在 OSWorld-Verified 达到了 78.4%,SWE-Bench Pro 拿到 55.1%;早期的 OpenAI Operator 在 OSWorld 上仅为 38.1%,而人类基准线是 72.4%。耐人寻味的是,Meta 至今未为消费端的 Muse 公布经过独立复现的标准评测成绩。

在路线选择上,竞品阵营普遍极其审慎。OpenAI 偏向受限的远程浏览器方案,高频弹出人工接管提示;Anthropic 则坚守严格沙盒与容器运行,在 2026 年多项学术调查的用户信任度对比中持续居于前列。反观 Meta,不仅公众信任赤字最为严重,TechRadar 等媒体在实测后更是直言将其接入日常生活令人不安。

主流 Agent 基准评测表现(OSWorld-Verified) 人类基准水平 72.4% Gemini 3.5 Flash 78.4% OpenAI Operator 38.1%

即便底层安全机制漏洞百出,Meta 推进商业化的脚步却异常迅猛。2026年9月28日,Meta 宣布成立 Meta Enterprise Platform,挖来前 MongoDB 首席执行官 CJ Desai 掌舵,力推企业级 Muse 代理、开发者 API 以及 Muse Code;紧接着在 9 月 29 日,宣布将连接范围大肆扩展至 Asana、Figma、Notion、Stripe、QuickBooks 和 Shopify。甚至在硬件端,扎克伯格还在力推内置 5G 模块、脱离手机也能自主交互的独立硬件 Muse Charm。

我不太买账的是这种用功能全能化掩盖安全黑洞的打法。二手平台的一次误判只是折射其鲁棒性不足的火星,但如果这套缺乏强约束的语义代理接管了企业的 Stripe 账单、Slack 内部沟通或 Notion 文档库,一次越权输出可能直接导致商业机密与财务合规防线的全面坍塌。

《韩非子》有云:“患在忽易,病在轻重。”面对大模型的不确定性,Meta 试图用激进的自动化体验去抢夺市场份额,却把最致命的物理安全与隐私代价留给了毫无防备的用户。没有确定性熔断机制的自主智能体,给得越多,错得越狠。

  • 建议.在智能体架构未能彻底解决语义越权问题前,任何用户与企业都不应开放涉及物理行踪、资金划扣与核心机密的单向自动执行权限。