8月14日起,Claude Code的Pro、Max、Team账户会发生一件不起眼但影响深远的事:Auto模式变成默认设置。以前你每让它执行一条命令,它就弹窗问一次;以后它自己判断该不该问。Anthropic 3月就放出过测试版,这次是把它从“可选项”升级成“出厂设置”。
这不是简单的“少弹窗”。它把审批这件事,从人交给了另一个AI。
谁来判断“危险”
Auto模式背后是一个独立的分类器,专门给每次工具调用打risk分。只有被判定为“不可逆、破坏性、指向环境外部”的操作,才会被拦下来问你;其余的,它直接做。
更值得留意的是两个细节。第一,如果分类器连续3次或累计20次拦截操作,Claude Code会自动降级回人工逐条批准模式——相当于它自己觉得“今天风险偏高,别自动了”。第二,你之前设的宽泛放行规则,比如允许所有Bash命令或所有python脚本自动执行,在Auto模式激活期间会被临时忽略,防止有人绕过分类器直接开无限权限。
这套设计的潜台词很清楚:Anthropic不信任“万能白名单”,但信任分类器的实时判断。这本身就是一次立场表态。
Anthropic自己晒出的数据
官方给了两组对照数字。在1,053名测试者的实验里,人工审批只识别出13.6%被插入的危险命令,Auto模式的分类器识别出89%。在标记的生产会话中,人工批准模式下出现严重意外损害的比例是6.3%,Auto模式下降到2.4%。
这组数据能解释为什么人工审批看起来在“防守”,实际形同虚设:官方文档提到,用户日常会批准97%的权限提示,连续通过五十次提示后,人为检测率会掉到5%左右。这就是“审批疲劳”——弹窗越多,人越机械地点“允许”,审批本身失效。
但这些数据全部来自Anthropic自己的实验,样本设计和测试环境是否代表真实生产场景,没有第三方验证。更值得注意的是,Anthropic在自己的文档里也承认,这个分类器是概率性的,不是安全边界,对高风险的生产变更仍建议人工审查。这句话和它对外的营销话术,多少有点打架。
顺带一提一个不算起眼的计费变化:从8月7日起,分类器运行产生的token开销不再计入Pro、Max、Team用户的用量额度。免费的东西,用起来才没有心理负担——这大概也是Anthropic铺垫默认切换的一步。
真实摩擦:误判才是麻烦
- 风险.社区反馈里最常见的抱怨不是“太危险”,而是误判——SSH连接、Terraform变更、部署操作这类合法但敏感的动作,容易被分类器错拦,反而打断了原本流畅的工作流。
这提示一个现实:分类器擅长识别典型的“危险模式”,但运维场景往往规则复杂、上下文依赖强,恰恰是分类器最容易翻车的地方。已经有用户提前切到更激进的bypass模式,图省事,这本身就说明产品的摩擦点没解决干净。
值得留意的是,这次默认切换只覆盖Pro、Max、Team账户,Enterprise和API渠道暂时仍是可选。企业客户的高风险场景更多、责任链更重,Anthropic没有把默认权推给他们——这多少说明它对这套机制在复杂生产环境下的信心,还没到敢“一刀切”的程度。
三种安全哲学,谁更靠得住
同行给出的答案并不一样。OpenAI的Codex CLI默认在受信仓库内自由执行,但靠操作系统级沙箱兜底——工作区外访问受限,网络默认关闭,逻辑是“先隔离,再放手”。Google的Gemini CLI则更保守,写入和shell命令仍要逐条批准,自动模式要手动开更激进的档位才接近全自动。
三条路线,三种赌法:Claude赌决策层能提前拦住坑,Codex赌执行层的隔离能兜住坑,Gemini赌人还得盯着坑。孙子讲“知彼知己,百战不殆”,可这里没人能真正“知彼”——谁的分类器、谁的沙箱,都没经过一次公开、真实、代价惨重的生产事故检验。
效率是看得见的,事故是看不见的,直到它发生。
Auto模式确实解决了审批疲劳这个真问题:弹窗太多,人会麻木,麻木比机器犯错更危险。这一步Anthropic做得不算莽撞。但把判断权交给一个自称“不是安全边界”的分类器,本质上只是换了一个更聪明、但同样不透明的把关人。8月14日之后真正该看的,不是Anthropic的测试数据,而是第一起被分类器放过的真实事故什么时候出现,以及出现后,Anthropic会不会把默认设置悄悄调回去。
