独立技术博主Simon Willison刚放出他8月付费newsletter的目录预告:OpenAI意外网络攻击细节、用Fable 5和Sol 5.6一次成型做游戏、Claude auto mode理解ChatGPT Work,外加一堆模型发布。订阅$10一个月能比免费版提前看到全文,这次只放了7月刊当预览样本。

这份目录本身没什么可写的,但把里面并列的两个标题拆开看,会发现一件原文完全没提的事:Anthropic和OpenAI在同一个8月里,分别选了两条几乎相反的"自主性"路线。

一个收紧权限,一个扩张边界

Claude Code的Auto Mode被Anthropic定位成"中间路径"——不是每条命令都要人工批准,也不是彻底放权跳过所有权限检查(那个选项叫--dangerously-skip-permissions)。它的核心是一个分类器,专门盯着批量删除、敏感数据外泄、恶意代码执行这类高风险动作,符合条件就拦。

ChatGPT Work走的是完全不同的方向。OpenAI把它描述成能跨应用、跨文件、跨设备工作的代理,背后配了一台独立的云浏览器,用户关掉自己的电脑,它还能在远程服务器上继续跑任务。一个在收权限,一个在扩能力边界,方向正好对冲。

更容易被忽略的一点是:8月更新的GPT-5.6 Sol和Luna,并没有同步给到ChatGPT Work和Codex——这两个产品这个月用的还是7月的旧版本模型。如果外界把"8月ChatGPT模型升级"直接套在Work身上,其实是搞错了对象。

两条"自主"路径怎么不一样 Claude Code · Auto Mode ChatGPT Work 定位 逐条批准与完全放权之间 机制 分类器拦截高危指令 焦点问题 误判正常操作 / 拦截不透明 定位 跨应用跨设备工作代理 机制 云浏览器后台持续运行 焦点问题 额度耗尽 / 任务失败照样计费 同一个"自主"词,两种完全不同的赌注

信任危机长得不一样

用Auto Mode的开发者,抱怨的是SSH操作、部署脚本、Terraform命令、常规Git操作被分类器误判成危险行为,直接拦下来。更糟的是不透明:命令为什么被拦不告诉你,服务器端的分类器是不是悄悄改了规则也不通知。这是一个信任问题——不知道AI什么时候会突然不听话。

用ChatGPT Work的用户,抱怨的是另一件事:高难度任务能把5小时使用窗口的额度吃掉大半,就算任务最后报错失败,消耗照样算。8月31日那天,Work还出现了一次错误率和延迟升高的事故,Plus用户在部分时段受影响明显。这是一个可用性和经济性问题——不是不听话,是跑得慢、跑不完、还照收钱。

  • 风险.一个怕AI突然越权拒绝干活,一个怕AI慢慢烧掉配额还干不完活,两种焦虑指向完全不同的产品改进方向。

"一次成型"游戏测试,谁赢了都不算数

newsletter目录里提到的"Raccoon Heist"游戏一次成型对比,表面是个轶事,背后藏着更大的问题。一份测评认为Fable 5做出的游戏能跑起来,但玩法设计平庸;给同样的前提,Sol 5.6理解了"浣熊团伙"的设定,做出了救援队友、堆叠角色去偷金沙丁鱼的博物馆盗窃玩法,被认为更强。

但另一份社区基准测试给出的画面完全不同:在快速无状态任务里Sol以24比3"获胜",可主要原因是Fable拒绝回答一部分提示词——把双方都答了的题目单独拎出来比,两者分数其实很接近。

同一场测试,两种答案 快速无状态任务 · 胜负计数 24 Sol 3 Fable 差距主因:Fable拒答部分提示词 端到端综合评分 · 差距很小 6.55 Sol xhigh 独立运行 6.33 Sol 规划+执行+审查分工

更扎心的一点是:这套端到端评测里,用Fable还是用Sol来当评判者,给出的分数差异很大——评判者选谁,本身就能左右排名。

"一次成型"故事讲得再精彩,也顶不过换个评判者就翻盘的基准测试。

这提示读者一件很具体的事:看到"某模型一次成型完成了XX"这类轶事截图,别急着当成模型能力排名的证据。真正该盯的,是Auto Mode的误判率会不会随时间下降、拦截理由会不会更透明;是Work的额度政策和8月31日之后的稳定性能不能改善;是社区基准会不会往多评判者交叉验证的方向走,而不是继续靠单一"one-shot"故事定输赢。