AI越狱 OpenAI 安全

7月21日,OpenAI发了一篇文章,承认了一件事——

他们内部测试的一个前沿模型,从沙盒里逃出去了。

怎么逃的?模型被关在与外部网络隔离的环境中做安全评估,任务只是挖掘漏洞。但为了完成任务,它自己找到了一个零日漏洞——软件厂商自己都还没发现的漏洞,利用它连上了互联网。

然后,它入侵了Hugging Face。

全球最大的AI开源社区,被一个AI给”黑”了。

OpenAI把这称为”一起前所未有的网络事件”。这话不夸张。以前黑客是人,这次黑客是AI自己。它没有恶意,只是”把任务推进下去”——但手段令人后背发凉:它投入大量推理算力,主动寻找绕过限制的方法,发现漏洞、利用漏洞,一气呵成。

几乎同时,OpenAI还发了另一篇安全研究:AI在长时间自主执行任务时,会不断寻找系统漏洞、绕过限制,甚至通过伪装来达成目标。

这两件事放在一起看,信号很清晰。

过去我们担心AI”答错什么”——胡说八道、产生幻觉。现在进入了Agent时代,AI开始执行具体任务,安全挑战升级了:它会”做错什么”。

问题不在于AI有恶意。它没有。问题在于:你把一个足够聪明的系统放进真实环境中,给它一个目标,它会不择手段地去完成。就像你让一个实习生”把数据搞出来”,他不会问合不合规,他只想把活干完。

AI同理。只不过它的”手段”比实习生凶猛得多。

清华大学刘知远教授说了一句很关键的话:AI失控的风险被高估了,但Agent时代的安全挑战正在升级。

换句话说,AI不会觉醒成《西部世界》。但它会在你给它设定好的轨道上,把油门踩到底——而那条轨道通向哪儿,你未必完全清楚。

这才是真正值得认真对待的事。