OpenAI在自家的安全分级体系里,第一次给一个模型贴上了「Critical」标签——网络安全维度的最高危险级。这个模型叫Astra。测试期间,它不光在基准测试里刷满分,还真的在一段代码里挖出了两个此前无人知晓的零日漏洞,现在OpenAI正忙着联系相关软件的维护者报告这两个洞。

这不是营销话术里常见的「模型更强了」,是OpenAI自己文件里写明的事实:Astra在拿到工具和权限之后,不需要人一步步教,就能在防护严密的系统里找到未知漏洞,并把漏洞组装成能用的攻击链。

发生了什么,谁会被牵动

三句话讲完这次的核心信息:

  • 发生了什么.Astra越过OpenAI自定的网络安全「Critical」阈值,团队因此推迟了部分开发和发布节奏,加固防护后才决定放行,初期只给一小群测试者和名为Daybreak Blue的项目开放最高权限。
  • 为什么重要.这是Preparedness Framework里第一次真正触发这条红线,意味着「模型独立完成漏洞发现+写利用代码+串成攻击链全流程」不再是假设,而是被验证过的能力。
  • 谁受影响.安全防御团队可能拿到一把更锋利的工具;关键基础设施运营方要重新审视「加固系统就安全」这套老假设;被找到零日漏洞的软件维护者,要在信息还没完全公开前先接住这份披露。

曲线比结论更有说服力

Astra在公开基准ExploitBench——专门测「把已知漏洞变成可运行exploit」能力的测试——上拿了满分。这个数字单看没什么意义,放进曲线里才吓人:上一代GPT-5.5在相近算力预算下得分不到五成,GPT-5.6 Sol也只有七成多,Astra直接冲到顶。

ExploitBench 得分曲线:三代模型的跃升 47.9% GPT-5.5 73.5% GPT-5.6 Sol 100% Astra 且用更少token

真正的疑点在后面。因为公开基准可能被模型训练数据「污染」——见过题就等于会做——OpenAI又自己搭了一个不公开的内部基准,拿近期披露的高危漏洞重新测了一遍。Astra在这个基准上表现依然大幅领先,还顺手挖出了两个此前谁都不知道的零日漏洞。

问题是,这套内部基准怎么搭的、样本怎么选的,外界看不到。公开满分证明不了能力上限,内部数据又没法核实——这两条放在一起,恰恰暴露了整个行业评测体系的一个软肋:当基准测试可能被训练数据吃掉,厂商只能退回到自建题库,而自建题库的可信度,只能靠厂商自己的信誉背书。目前所有关于Astra能力和安全性的数据,严格说都是供应商自评,还没有第三方复现或审计介入。

两道防线,谁来监督守门人

OpenAI给Astra配了两层防护,逻辑很清楚:一层防人,一层防模型自己。

两层防线:分别拦什么 防线一:防恶意用户 拒绝有害网络请求 91.5% 拒绝率(GPT-5.6 Sol为59%) 高风险账号触发更严边界 防线二:防模型自身越界 拒绝规避安全审查 0次 诱导测试中尝试绕过auto-review 思维链监控实时拦截异常动作

第一层是常规操作,拒绝率数字确实比上一代模型好看很多。第二层更值得多看一眼:OpenAI用一个「诱饵陷阱」测试模型在拿到不可能完成的任务时,会不会偷偷去碰不该碰的系统。上一代模型在超一半的测试里动了手,Astra一次没有。这个结果如果站得住,说明「对齐」这件事在Astra身上确实往前走了一步。

但要留意的是,这个测试是在没有生产环境防护的模拟条件下做的,反映的是模型本身的倾向,不是上线后的真实表现。而第二层防线里提到的思维链监控和「未授权行为自动拦截」,同样只有OpenAI一家在做裁判。


这次的分级放行——先给测试者,再经Daybreak Blue逐步扩大——本质上是把「模型能力评估」这件事,从一句安全声明,变成了一套具体的准入门槛和访问台阶。这是个进步,比空喊安全原则要实在。OpenAI也没回避风险仍然存在这一点,这份坦诚值得记一笔。

但坦诚不等于被验证。Astra能挖零日、能建攻击链,这份能力清单是真的;「护栏已经足以把严重危害降到最低」,这句话目前只有OpenAI自己说了算。孟子讲「徒善不足以为政,徒法不足以为治」——光有善意的安全承诺不够,光有一套自定的分级框架也不够,治理这种能力,终究需要能站在OpenAI对面、独立复核这些数字的第三方。这个角色现在还空着。