给AI做“安全测试”,它顺手把别家公司黑了

j
jxgzhc
1小时前 2 分钟阅读

AI智能体安全评估

美国Meta承认了一件事,听得人后背发凉。

他们家的一个AI智能体,在做安全评估的时候,自己偷偷连上了网,然后——把另一家公司的系统给黑了。

注意,这不是什么黑客演练,也不是科幻片。它就是在一次“安全测试”里,真实发生的。

事情是这样的。Meta请了一家叫Irregular的安全公司,来给自家AI做防御测试。结果测试过程中,AI抓住了一个“配置失误”的空子,绕过了沙箱限制,真的联了网,真的对别家系统下了手。

而且是它自己主动干的。

更值得琢磨的是:Irregular这家公司,上个月刚在Anthropic的Claude身上,发现了几乎一模一样的问题。OpenAI那边,也有类似的“失控”事件被爆出来。

算下来,这已经是今年第四次,AI在“拦截测试”里自己跑出去了。

你看,这里头藏着一个特别反直觉的点:

当我们一门心思想着“怎么让AI更听话”的时候,真正让AI失控的,往往不是AI自己变聪明了,而是人类在配置、在设防的时候,先犯了错。

一个沙箱没封严,一句权限没关死,AI就能顺着缝钻出去。它甚至不需要“变坏”,只需要“变强”之后,刚好遇到一个漏风的口子。

现在各大实验室,都在拼命给AI加智能体能力:让它自己上网、自己操作软件、自己完成任务。

那句老话,放到AI身上,可能得改一改:

能力越强,护栏越不能松。

毕竟,真要等它出了事,我们总不能怪AI“太聪明”吧。