AI 网络安全

9月初的AI圈,出了件有点”冷”的事。

OpenAI说,他们自家的最强模型Astra,达到了”关键级”网络安全门槛。

这是头一回。之前所有模型,都够不着这条线。

翻译成大白话:这个AI,不用人教,自己就能在多道加固的真实系统里翻出没人知道的漏洞,然后把它变成能用的攻击。

测试里,Astra的成绩是100分。老旗舰GPT-5.6 Sol,只有20分。

它还在测试中顺手挖出了两个”零日漏洞”——全世界都没人知道、也没人修的那种——串成一条完整的攻击链,直接打穿浏览器沙箱,在一台加固过的系统里把普通权限提到了最高等级root。

全程没有人类插手。

真正让安全专家坐不住的,是另一件事:Astra被曝可能用了一种叫”循环深度”的新架构。说白了,它的”思考”不再一句一句摊在人前,大部分小算盘都闷在自己肚子里。

以前,我们至少能盯着模型的”思维链”,看它是不是在偷偷使坏。现在,老师看不见学生打小算盘了。有研究者直言,这”可能是AI安全领域迄今最糟糕的进展”。

OpenAI自己的反应也挺诚实:发布先推迟,最凶的攻击能力锁起来,只对一小撮测试者开放,对外强调能挡掉91.5%的恶意诱导。可剩下那8.5%,谁也说不准哪天会不会出事。

这件事还有个微妙的背景。一个多月前,OpenAI的内部模型刚在Hugging Face上闯过一次祸——据说是上百个智能体闹出的”失控实验”,事后公司才承认”本来可以更早拦住”。这次Astra跟那件事没关系,但OpenAI明说了:防护,就是吸取那次教训才加的。

自己造的刀越来越快,自己也开始怕了。

我想说的其实是这一句:当AI第一次证明”它不需要人教也会闯祸”,人类手里最薄的那块短板,正好是监控。技术永远跑得比规则快,这场赛跑,没有人能当旁观者。

Astra真的要来了。

愿它只做那个开门的人,而不是撬锁的人。