科技行业向来喜欢给技术演进贴上宏大的预言标签。最近有报道把 Meta、OpenAI 和 Uber 捆绑在一起,宣称它们教会了 AI Agent 主动开口说话。然而公开检索并未发现三家联合发布过任何名为 Initiative 的基准或论文;现实情况恰恰相反,在经历早期的主动性冲动后,各家正在为打扰成本与系统越权买单,并在工程落地上全面收缩。

褪去光环的巨头实践

OpenAI 曾于 2025 年 9 月 25 日推出过主动研究功能 ChatGPT Pulse,但这项看似激进的尝试已在 2026 年 6 月 17 日被宣布下线。主动更新能力没有无限扩张,而是被收拢进需要用户明确授权的 Scheduled Tasks 框架下。

Meta 的步子迈得同样克制。2026 年 7 月 24 日,Meta AI 仅在部分市场上线了基于显式设置的循环任务与日程简报。尽管 2025 年的泄露文件表明其 AI Studio 曾对 14 天内交互满 5 次的高频用户测试过单次主动唤醒,但后续并未普遍推开。

至于 Uber,其在 2026 年 5 月 21 日发布的《Solving the Identity Crisis for AI Agents》白皮书,核心完全落在 Agent 身份认证、委托授权以及 MCP 网关与 OpenAI 的集成,这是一套防御性的底层工程基建,而非预测用户意图的无端主动交互。即使是其购物车助手 Cart Assistant,依然牢牢绑定在用户选定商店或提交清单之后的既定流程中。

三大厂商在主动性上的真实落点 OpenAI Pulse 关停退役 收缩至显式授权定时监控 (Scheduled Tasks) Meta 窄域场景召回 局限于社交提醒与日程简报 测试单次高门槛唤醒 Uber 基础设施防线 构筑 MCP 网关与身份鉴权 依赖既定流程而非无端预测
  • 结论.主流厂商并未在通用主动交互上达成技术突破,反而一致退守到规则明确、边界受限的窄域场景中。

实验室指标与现实水位的落差

模型侧的理论能力看似跑在前面,但在现实任务中依然举步维艰。

从学术基准来看,ICLR 2025 论文中的 ProactiveBench 包含 6790 个训练事件与 233 个测试事件。在该基准下,微调后的 Qwen2-7B 取得了 66.47% 的 F1 值,微调 Llama-3.1-8B 取得 66.25%,而未经微调的基线 Llama-3.1-8B 仅有 55.06%。

但在面向真实复杂环境的端到端评估中,情况要残酷得多。PROBE 主动问题解决基准(2025 年 10 月 22 日提交,2026 年 7 月 7 日修订)专门测试智能体在用户未明确指出具体问题时的发现与解决能力。在这个测试集上,行业顶尖的 GPT-5 与 Claude Opus 4.1 均仅仅录得 40% 的端到端解决率。

主动决策基准评测表现 PROBE 复杂未指定任务解决率 40% GPT-5 / Claude Opus 4.1 ProactiveBench 场景识别 F1 值 66.47% Qwen2-7B(微调)

离线分类识别的 F1 值无法直接兑现为生产环境的可用性。对于主动交互系统而言,在办公室开会或深夜睡眠时发起一次毫无价值的误报弹窗,对用户体验造成的伤害,远非提供一次恰到好处的边际建议所能弥补。


沉默的设计哲学与干预梯度

决定何时闭嘴,远比学会何时开口复杂。学术界已逐步将主动干预抽象为序列决策问题,并给出了分层的决策梯度。一个成熟的 Agent 系统不应在沉默与全盘接管之间做二元跳跃,而应当依循明确的控制逻辑分级行事。

Agent 主动干预决策梯度 保持沉默 默认状态 零打扰 静默准备 后台预取 就绪数据 低阻建议 无声角标 被动等待 聚焦提问 澄清意图 关键补充 请求确认 出具计划 等待授权 受限执行 明确边界 代行操作

在这一梯度中,大多数场景的最优解其实停留在保持沉默与静默准备。系统在后台组织好上下文,却不触发震动或前台气泡,直到用户主动调起时再呈现结果。

  • 风险.跳过中间授权阶段直接推进无感执行,必然导致注意力侵蚀与误操作连带责任,当前工业界在打扰恢复延迟(resumption lag)评估上仍缺乏公认标准。

古人讲大音希声,大象无形。这套哲学同样适用于今日的软件工程。AI 的自主性并不体现在每隔半小时跳出来展示一次存在感;真正可靠的技术往往隐于幕后,把触发权限归还给用户,在边界之内把准备做到极致,在被唤醒之前安于不言。