OpenAI这篇新博客标题叫《The Work Now Within Reach》,通篇讲的是一个好听的故事:模型更强,能做的事更多,商业就能滚起雪球。但同一批发布材料里还有一句话,OpenAI没写进这篇战略文章——GPT-6 Astra是公司历史上第一个被内部安全框架评为"Critical"级网络安全能力的模型。一边说"工作触手可及",一边悄悄给攻击能力打了最高风险分,这两件事被讲述的方式完全不对等。

跑分之外,还有多少没说清

原文只用了"世界最智能、最对齐"这种定性描述,没给一个具体分数。补全之后能看到,Astra在ARC-AGI-3拿到99.9%,FrontierMath Tier4是98%,GPQA Diamond 96.0%,这几项都是常规意义上的"顶尖"。但真正扎眼的是另一条线——攻击性网络安全测试ExploitBench,Astra拿了100%,ExploitGym 42.4%,SRE-Bench单次尝试88.0%。这些分数让它同时进入OpenAI Preparedness Framework里的"Critical"档,是这套框架第一次给模型定这个级别。

跑分单上,攻击能力也排前列 ARC-AGI-3 99.9% FrontierMath T4 98% GPQA Diamond 96.0% ExploitBench(攻击) 100% BrowseComp 91.5% OSWorld 2.0 72.6%

定价方面,API标准档每百万输入token 10美元、输出50美元,Fast模式速度翻倍、价格也翻倍。开放节奏是先给部分组织试用,再逐步铺到ChatGPT Plus/Pro/Business/Enterprise、API、Azure、AWS Bedrock;企业版默认关着,要管理员手动打开。现在版本会直接拒绝生成漏洞概念验证(PoC)之类的高风险请求,OpenAI说未来打算开放防御性用途,比如漏洞验证、恶意软件分析。

0%对48%,一个精心挑选的对照

原文里最漂亮的一条安全数据是"越权执行任务比例0%"。但这个0%不是跟别家模型比出来的,是跟没加生产安全护栏的GPT-5.6 Sol比——那个版本的越权比例是48%。

越权执行对比:跟谁比很关键 无护栏版本 GPT-5.6 Sol 48% 越权执行任务比例 生产护栏版本 GPT-6 Astra 0% 越权执行任务比例 对照对象:同一模型的护栏前后,非跨厂商横向比较

跟自己历史版本比,而不是跟同行比,这个对照更像是一份"护栏生效了"的内部质检报告,不是行业横向的安全水位测量。更关键的是,这批分数——跑分和安全分——都是OpenAI自己跑出来、自己公布的,评测用了什么prompt、多大算力预算、有没有工具调用加成,外部一概不知,目前也没有看到第三方复现。

  • 风险.攻击性能力被评为Critical级,说服外界"安全可控"的证据,主要来自厂商自证的护栏数据。

双轮驱动,讲的还是那套老故事

原文的商业主线是消费端和企业端互相喂养:用户在家用熟了ChatGPT,带着习惯去公司用;企业场景又反过来抬高个人使用的期待。个人ChatGPT用户六个月后的每日消息量比第一个月高出约五成,尝试过的任务种类翻了一倍——这是原文自己给出的增长曲线。

算力这条线更实在。GPT-5.6 Sol把服务成本压低了20%,token生成效率提升超过15%;自研推理芯片Jalapeño在InferenceX测试里,每瓦吞吐量是对比商用芯片的1.5到1.9倍,端到端延迟低1.7到3.6倍,计划年底前开始部署,配合NVIDIA、AMD等伙伴的加速器一起用。

OpenAI讲的正循环 消费+企业渗透 全栈算力降本 收入增长 反哺下一代研发

研发内部的数据也放出来了——OpenAI的研究团队现在每1个人类工作日,配套3.1个agent工作日。人依然定优先级、判结果,但大量执行环节交给了agent。

  • 结论.agent先在OpenAI自己的研发流程里替代了执行环节,外部企业接入类似能力后,最先被挤掉的会是执行密集、判断稀疏的岗位。

我怎么看

老子那句"祸兮福之所倚,福兮祸之所伏"放在这次发布上刚好合适:能力越强,可用来做坏事的余地也越大,两头是一起涨的,不是先享受红利、后处理风险的顺序关系。

OpenAI这套消费+企业+全栈算力的叙事讲得很顺,顺的部分都是可控变量:成本、渠道、定价。不顺的部分——网络安全滥用、第三方验证、岗位替代——恰恰是它自己讲不出漂亮数字的地方。

模型越聪明,遮住的那部分往往越值得看。

企业客户现在拿到的是一个默认关闭、需要管理员手动打开的开关,这个动作本身就是最诚实的注脚——OpenAI比谁都清楚,这次的"更强"附带条件更多。接下来最该盯的不是跑分会不会更高,而是被评为Critical级的攻击能力,在开放给更多组织之后,能不能真的被管住。