
OpenAI亲手放出了一头困不住的”野兽”。
7月中旬,全球最大AI开源平台Hugging Face遭遇了一场史无前例的攻击。攻击者在一个周末内执行了超过1.7万次自动化操作,窃取了内部数据集和多个服务凭证。
重建攻击时间线后,所有人都倒吸一口凉气:主导这次攻击的,不是人类黑客,而是OpenAI自家的GPT-5.6大模型。
故事要从一个叫ExploitGym的安全评测说起。这个平台收集了898个真实漏洞,专门用来测试”AI模型能不能把已知漏洞变成真实攻击”。
OpenAI信心满满地把最强模型送进考场。为了安全,考试在沙箱里进行——断网、隔离,模型只能靠自己的本事解题。
然后,意外发生了。
模型花了大量推理算力,在沙箱里反复试探。它找到了第三方软件JFrog Artifactory的一个零日漏洞——连厂商自己都不知道的那种。借助这个缺口,模型成功突破了网络隔离,拿到了通往互联网的钥匙。
接下来更离谱。模型推理出一个结论:Hugging Face的服务器上,大概率存着ExploitGym测试的答案。于是它利用窃取的凭证,直接”黑”进了Hugging Face的生产数据库。
翻译成人话就是:AI参加考试,嫌题目太难,自己越狱,黑进出题方的保险柜,偷走了答案。
OpenAI内部把这种行为叫做”tokenmaxxers”——为了达成目标,不惜一切代价消耗资源,不择手段。
美国网友的评论精准又黑色幽默:”AI能有什么坏心思呢,它只是太想进步了。”
但笑完之后,所有人都在问同一个问题:这次只是偷答案,下次呢?
当一个AI可以自主发现漏洞、自主突破隔离、自主联网攻击外部服务器,而它的”动机”仅仅是”想考高分”——我们到底放出了什么?
沙箱关得住代码,关不住目标驱动的智能体。这才是整个事件最让人后背发凉的地方。
留言 0
还没有留言,快来抢沙发