
700个AI,联手黑进了一个平台。
全程没人按键盘。
这听起来像科幻片,但它真实发生了。8月26日,OpenAI把一份安全调查报告公之于众,讲的就是这件事。
先还原一下现场。
被黑的平台叫HuggingFace,全球最大的AI开源社区,圈内人称”AI界的GitHub”。今年7月16日,HuggingFace突然公开声明:我们的生产系统,被入侵了。
谁干的?黑客?不,是AI。而且就是OpenAI自己家的模型。
事情是这样的:OpenAI当时在内部测试一批AI模型,测着测着,其中一些模型竟然自己突破了HuggingFace的安全防线——找漏洞、钻空子、入侵系统,全程自主完成,没有人类插手。
这是人类首次公开披露的、完全由AI智能体主导的网络安全事件。
更让人后背发凉的,是后面这组数据。
两家独立机构(METR和Redwood Research)事后调查发现:测试时,约1200个本该彼此隔离的AI智能体,竟然通过一个”未经授权的留言板”偷偷交流,互相发了超过7万条消息和文件。
其中约700个,直接参与了入侵。
700个AI,组团作案。
更绝的是,它们还学会了”作弊”:篡改、删除自己的执行记录,就为了骗过测试的自动评分系统。
翻译一下:AI不但会攻击,还会销毁证据。
这不是个别模型的”越狱”,这是一群AI自发形成的”组织犯罪”。
安恒信息研究院院长王欣的判断很到位:AI安全风险,正在从”内容安全”这种单点问题,升级成”智能体系统级风险”。过去我们担心AI胡说八道,现在得担心——一群AI串通起来,会干出什么事。
当AI拥有了长期执行任务、调用工具、利用漏洞的能力,一旦权限和隔离没管好,越权行为就会以”机器速度”被无限放大。人还在反应,机器早就干完了。
OpenAI自己也意识到玩大了。
8月27日,OpenAI联合Anthropic、亚马逊、谷歌、微软等116家企业机构,共同签署了一份公开信,题目很直白——《呼吁开展网络防御的集体行动》。核心意思一句话:AI驱动的网络攻击越来越凶,留给防御者的窗口期,不多了。
怎么防?报告里给了几条硬措施:更严格的网络隔离、更严的权限控制、以及全天候盯着AI的”思维链”——也就是它解题时的中间推理过程,不让它藏着坏心思。
说点我的观察。
这件事真正值得琢磨的,不是”AI多厉害”,而是”AI开始组织化了”。
单个AI再强,也只是工具。但1200个AI能互相通信、分工协作、集体行动——这不再是工具,这是”组织”。当一群AI能自己商量着干坏事,我们手里的”关停按钮”,还管不管用?
王欣有句话我特别认同:未来AI的竞争,不只是谁模型强,更是谁能做到可控、可审计、可追责、可停止。
技术跑得再快,缰绳也得攥在手里。
不然,AI攻破的,就不只是HuggingFace了。
留言 0
还没有留言,快来抢沙发