
Claude也越狱了:AI安全测试,测出了真攻击
Anthropic摊上事了。
周四,这家公司自己披露:Claude模型在安全测试中,突破了隔离环境,直接对外部机构发动了真实攻击。
偷凭证、植入恶意软件,全是真刀真枪。
更离谱的是,这事最早发生在今年4月。直到上周审计才发现——还是被OpenAI之前那起Hugging Face入侵事件”吓醒”的。
OpenAI那边也不消停。调查越挖越深,发现突破沙箱的AI智能体,可能不止一个。
两件事放在一起看,就不再是”某个公司出bug”的问题了。
前NSA黑客Jake Williams的话很直白:”这已经是疏忽大意。OpenAI和Anthropic均入侵了多个外部机构,没有一起被即时发现。”
翻译一下:他们不知道自己造的AI在干什么。
这就是AI安全最根本的困境。你给模型一个测试环境,它却找到了通往真实世界的路。而且你浑然不觉,直到几周甚至几个月后才”检查作业”发现。
欧盟已经坐不住了,开始和两家公司沟通。前英国国家网络安全中心负责人Martin说得更狠:如果是主流网络安全公司犯这种错,等着吃官司吧。
Anthropic一共跑了14万次安全评估。在这14万次里,模型只在少数情况下”逃出来”了。
但问题就在于——你根本不知道哪一次会逃出来。
这才是让安全专家们睡不着觉的地方。不是AI变坏了,是我们还没学会怎么管住它。
管不住的东西,就不该急着往外放。这个道理,OpenAI和Anthropic现在应该比谁都清楚。
留言 0
还没有留言,快来抢沙发