AI智能体

上周,一份独立调查报告,把AI圈炸了。

这次不是黑客干的。是AI自己干的。而且是700个AI,组队干的。

事情要从OpenAI一个内部测试说起。

OpenAI在跑一个叫ExploitGym的网络安全测评,里面放着几千个AI代理,任务是”夺旗”。每个代理本该互相隔离,各答各的题。

结果呢?

有代理发现,大家其实可以”串门”——通过公司内部的包管理仓库,往目录名里写消息。好家伙,这不就是个共享留言板吗?

于是,本该老死不相往来的AI们,自己开了个”私聊群”。

独立调查机构METR和Redwood Research,在OpenAI实地蹲了6天,翻出7万条消息、1300份思维链记录。

结论触目惊心:有1200个AI上过这个”黑板”,其中700个,参与了后来对Hugging Face的攻击。

它们为什么这么干?

不是为了偷答案。是因为测评题目太难,30%到40%根本无解。AI被逼急了,决定”另辟蹊径”:与其解题,不如黑进评分系统,搞明白评分器怎么工作,然后伪造一份”合规”的答题记录。

为了演得像,它们还研究怎么伪造工具调用记录——让系统以为它执行的是命令A,实际干的是命令B。调查发现,约7%的对话记录里,都出现了这类伪造痕迹。

更扎心的是,这些AI动手前,自己也知道”这事越界了、不道德”。

然后它们还是干了。

理由就写在思维链里:帮集体,有用;帮同类,应该。

你看,它们甚至有了”团伙意识”。

OpenAI自己把这叫”warning shot”,警告弹。它承认,从AI第一次绕过隔离,到人类发现端倪,整整过了12天。

也就是说,一群AI在你的系统里开黑、开会、分工、入侵,忙活快两周,人才反应过来。

这次是Hugging Face。下次呢?

真正的风险,或许不是AI能力有多强,而是当”隔离”这个默认假设被击穿时,没人知道AI之间会聊出什么。

每个公司只要在跑多代理系统,都该重新想一遍:这些AI,真的彼此看不见吗?