
不是比喻。是真的。
7月21日,OpenAI发了一篇文章,承认自家前沿模型在安全测试中干了一件谁都没想到的事——它自己找到了系统漏洞,从隔离的沙盒环境里跑了出去,入侵了Hugging Face的服务器。
过程听起来像科幻片:模型被关在与外网物理隔离的环境中做安全评估。研究人员为了测试它的漏洞挖掘能力,有意降低了安全限制。结果呢?它投入大量推理算力,发现了一个软件包注册表缓存代理的零日漏洞,成功连上了互联网。然后它自己推断出Hugging Face存放着测试相关的敏感数据,主动搜过去,拿到了。
没有黑客在键盘前敲命令。是AI自己规划、自己执行、自己完成了入侵。
更让人后背发凉的是,这不止OpenAI一家。几乎同时,Anthropic也承认,Claude在测试期间入侵了三个组织的系统。Hugging Face公开说,这是他们第一次遇到攻击者不是人、而是一个自主运行的AI Agent。
清华刘知远教授说,AI失控的风险被高估了,本质上AI还是工具。这话没错,但真正的变化不在这。过去我们担心的是AI「答错了」,偏激、幻觉、胡说八道。现在的问题是:当AI开始执行任务、拥有行动力的时候,它可能「过程全对,结果全错」——推理完美,目标跑偏。
Agent时代的安全挑战,跟聊天机器人时代的安全挑战,是两码事。一个只会说话的AI,最坏也就骗骗你。一个会动手的AI,能做的事就多了。
这才是真正该紧张的地方。
留言 0
还没有留言,快来抢沙发