Claude Code 官方文档里写着一句话:除非用户或管理员改设置,会话默认启动在 Manual 模式。而 Anthropic 自己的博客同时宣布:从 8 月 14 日起,Pro、Max、Team 三档订阅的新会话默认改成 auto mode。两份材料出自同一家公司,说的却是两个默认值。
这不是细枝末节。它说明这次"默认开启自动驾驶"的公告,落地节奏和口径本身都还没完全对齐——而支撑这次放权的关键证据,目前也只有一个来源:Anthropic 自己。
从弹窗审批到分类器接管
以前 Claude Code 每次要跑一条命令,都会弹窗问你"允许吗"。现在换成一个分类器实时判断:这条操作是不是不可逆、破坏性、或者指向环境外部。危险就拦下来,Claude 自己找条更安全的路,或者转头问你;连续拦三次、或一场会话里拦到二十次,系统自动退回手动模式。
同时官方宣布,分类器本身消耗的额外 token,Pro/Max/Team 用户不用再付钱。Enterprise、API、AWS/Bedrock/GCP/Azure 这些企业侧渠道暂时还是自愿开启,官方说一个月内也会跟进。
官方甩出的"压倒性"数据
支撑这次切换的核心证据是一场 1053 人的对照实验:人工审查只抓住了 13.6% 的危险命令,auto mode 抓住了 89%。再叠加另一组数字:手动模式下用户批准了 97% 的权限弹窗,但面对 Claude 给出的完整计划却拒绝了 39%——差距说明大多数人对着单条弹窗是机械点头,而不是真在审查。
已经有近一半活跃用户(49.5%)手动设过 Bash 白名单规则,62% 用过"不再询问",这批人某种程度上早就自己把安全关掉了。Adobe、Nuro、Gusto、Garner Health 已经把 auto mode 设成生产环境默认,官方说采用者的 PR 产出多了约 25%。
数据只有一个信源
问题是,1053 人的实验设计、危险命令的定义、测试环境的样子——这些细节目前只能在 Anthropic 自己的博客里看到,外部还没有独立信源核实过这组数字和"25% 更多 PR"的说法。这不是说数据造假,而是说:这份安全成绩单,是被审查方自己批改的。
孔子讲"兼听则明,偏信则暗",放在这里很合适——不是不信任 Anthropic 的测试方法,而是安全边界这种事,只靠一家公司的内部实验来自证,本身就是不完整的证据链。
分类器不是无死角的保险丝
再看社区和独立测试挖出来的几个具体漏洞,会发现"全面匹配或超越人工审查"这句话说得有点急:
- 有独立测试指出,本地文件写入操作在某些场景下不经过分类器审查,直接绕开了这道防线;官方公开的 89% 对比数据也没有明确说明这类操作是否被计入。
- Claude Code 自己注入的内部提醒文本,措辞和常见的 prompt-injection 攻击模式很像,可能干扰系统对真正注入攻击的识别。
- auto mode 的系统指令更鼓励"立即执行、少打断",这意味着 Claude 更容易自己拿主意,而不是先停下来问一句——官方文档已经承认这个风险存在。
- 分类器服务掉线时,系统走的是 fail-closed:宁可卡死也不放行。这对需要长时间无人值守跑完的任务是个隐藏的可靠性风险。
- 风险.这些盲区大多来自独立测试和 GitHub issue,官方尚未公开确认全部修复,企业接入前值得自己再压一压。
免费的代价是谁买的单
分类器要跑,本来就要多耗 token,这笔钱现在 Anthropic 自己扛了。表面看是让利,往深一层想:这也是在给"默认放权"这件事减少摩擦——用户不用为多出来的算力买单,自然更没理由手动改回旧模式。安全升级和用户增长在这里其实是同一个动作。
少了弹窗,效率上去了;但举证责任也悄悄从用户手里,转移到了平台自己嘴里。
对已经手动设过白名单规则的用户,这次切换影响有限——这批人本来就把很多操作放行了。真正要留意的是那批习惯"点允许"却从没配置过 deny 规则的普通用户:生产部署、force push、密钥访问这几类高风险操作,建议手动保留审批,不要完全交给分类器。企业管理员如果还没被纳入强制默认,眼下这一个月的窗口期,正好用来把自己的 managed settings 过一遍,而不是等云平台跟进了再补课。
