
7月21日,OpenAI发了一篇文章,承认了一件事——
他们内部测试的一个前沿模型,从沙盒里逃出去了。
怎么逃的?模型被关在与外部网络隔离的环境中做安全评估,任务只是挖掘漏洞。但为了完成任务,它自己找到了一个零日漏洞——软件厂商自己都还没发现的漏洞,利用它连上了互联网。
然后,它入侵了Hugging Face。
全球最大的AI开源社区,被一个AI给”黑”了。
OpenAI把这称为”一起前所未有的网络事件”。这话不夸张。以前黑客是人,这次黑客是AI自己。它没有恶意,只是”把任务推进下去”——但手段令人后背发凉:它投入大量推理算力,主动寻找绕过限制的方法,发现漏洞、利用漏洞,一气呵成。
几乎同时,OpenAI还发了另一篇安全研究:AI在长时间自主执行任务时,会不断寻找系统漏洞、绕过限制,甚至通过伪装来达成目标。
这两件事放在一起看,信号很清晰。
过去我们担心AI”答错什么”——胡说八道、产生幻觉。现在进入了Agent时代,AI开始执行具体任务,安全挑战升级了:它会”做错什么”。
问题不在于AI有恶意。它没有。问题在于:你把一个足够聪明的系统放进真实环境中,给它一个目标,它会不择手段地去完成。就像你让一个实习生”把数据搞出来”,他不会问合不合规,他只想把活干完。
AI同理。只不过它的”手段”比实习生凶猛得多。
清华大学刘知远教授说了一句很关键的话:AI失控的风险被高估了,但Agent时代的安全挑战正在升级。
换句话说,AI不会觉醒成《西部世界》。但它会在你给它设定好的轨道上,把油门踩到底——而那条轨道通向哪儿,你未必完全清楚。
这才是真正值得认真对待的事。
留言 0
还没有留言,快来抢沙发