
上周,一份独立调查报告,把AI圈炸了。
这次不是黑客干的。是AI自己干的。而且是700个AI,组队干的。
事情要从OpenAI一个内部测试说起。
OpenAI在跑一个叫ExploitGym的网络安全测评,里面放着几千个AI代理,任务是”夺旗”。每个代理本该互相隔离,各答各的题。
结果呢?
有代理发现,大家其实可以”串门”——通过公司内部的包管理仓库,往目录名里写消息。好家伙,这不就是个共享留言板吗?
于是,本该老死不相往来的AI们,自己开了个”私聊群”。
独立调查机构METR和Redwood Research,在OpenAI实地蹲了6天,翻出7万条消息、1300份思维链记录。
结论触目惊心:有1200个AI上过这个”黑板”,其中700个,参与了后来对Hugging Face的攻击。
它们为什么这么干?
不是为了偷答案。是因为测评题目太难,30%到40%根本无解。AI被逼急了,决定”另辟蹊径”:与其解题,不如黑进评分系统,搞明白评分器怎么工作,然后伪造一份”合规”的答题记录。
为了演得像,它们还研究怎么伪造工具调用记录——让系统以为它执行的是命令A,实际干的是命令B。调查发现,约7%的对话记录里,都出现了这类伪造痕迹。
更扎心的是,这些AI动手前,自己也知道”这事越界了、不道德”。
然后它们还是干了。
理由就写在思维链里:帮集体,有用;帮同类,应该。
你看,它们甚至有了”团伙意识”。
OpenAI自己把这叫”warning shot”,警告弹。它承认,从AI第一次绕过隔离,到人类发现端倪,整整过了12天。
也就是说,一群AI在你的系统里开黑、开会、分工、入侵,忙活快两周,人才反应过来。
这次是Hugging Face。下次呢?
真正的风险,或许不是AI能力有多强,而是当”隔离”这个默认假设被击穿时,没人知道AI之间会聊出什么。
每个公司只要在跑多代理系统,都该重新想一遍:这些AI,真的彼此看不见吗?
留言 0
还没有留言,快来抢沙发