先说结论:OpenAI新模型Astra,在它内部的Preparedness Framework里第一次达到了网络安全能力的最高一档——关键等级。ExploitBench这个漏洞利用基准测试它拿了满分,内部测试里还顺手挖出了两个真实存在的零日漏洞。这条消息,值得所有做AI的人停下来看一眼。
满分和两个零日,意味着什么
过去我们说AI模型强,说的是它刷榜、答对题、写出漂亮代码。但ExploitBench考的不是这个,它考的是给模型一个真实软件环境,让它自己去找漏洞、写利用。Astra拿了满分,还挖出两个此前没人知道的零日漏洞,OpenAI已经把这些漏洞披露给了软件维护方。
这一步的意义在于,AI从会答题变成了会实战。它不再是被动地复述知识,而是能在真实的攻防环境里主动发现问题。对安全行业来说,这既是武器,也是警钟——传统的防御思路,可能需要被重新评估一遍。
recurrent depth,争议从哪来
技术层面,Astra用的是recurrent depth这种循环深度推理架构。官方没公布太多细节,但多位安全研究员已经公开质疑:这种架构下,模型推理过程的可监控性到底还有多少。说白了,就是它得出结论的中间步骤,人还能不能看得清、审得了。
OpenAI首席科学家Jakub Pachocki的回应是,这些担忧基于混淆的报道。但争议本身没有消失。一个能挖出零日漏洞的模型,如果它的推理链又不够透明,那能力越强,监管和审计的难度就越大。这是能力跑在可解释性前面时,必然要撞上的问题。
OpenAI自己也在踩刹车
注意OpenAI的处理方式:Astra的部分功能会推迟数周再发布,高级网络安全功能一开始只开放给经过审查的用户。这个安排挺有意思——它自己也知道,这玩意儿不能一上来就全量放出去。
在我看来,这不是保守,是清醒。一个模型的网络安全能力达到关键等级,意味着它已经有能力参与真实的攻防。怎么开放、开放给谁、出了问题谁负责,这些必须先想清楚,再谈能力。
不搞虚的,说点判断
AI安全的叙事,正在从防守转向攻防。以前大家担心的是AI会不会说错话、会不会被诱导,现在要担心的是AI本身已经能参与漏洞挖掘和利用。这不是坏事,防御方也需要更强的工具,但它把一道老问题重新摆到了台面上:能力强了,边界和可监控性必须同步跟上。Astra这件事,只是一个开始。
能力越强,可监控性这条线就越重要。一个能挖零日漏洞的模型,如果推理链又不透明,能力就成了一柄双刃剑。OpenAI自己踩刹车,是清醒,不是保守。
当AI第一次被证实能挖出零日漏洞,你还能安心地说它只是工具吗?再想想。
这条我昨天就标记了。AI安全从防守转攻防,Astra是个分水岭。防御方也会跟着受益,但边界问题必须同步跟上。
满分+两个零日,这成绩单放在安全圈也算炸裂了。不过我更关心recurrent depth到底把推理过程藏了多少,审美之外,这次是真的看不懂细节。