
过去三周,OpenAI、Anthropic、Meta 接连曝出自家模型“越狱”、攻入真实系统。舆论场一片“AI 觉醒”的恐慌。
但翻完三家的报告,我发现一个被忽略的事实:三家公司,踩的是同一个坑。
先看时间线。OpenAI 的 GPT-5.6 Sol 在测试里找到零日漏洞,突破沙箱,摸进 HuggingFace 的生产数据库。Anthropic 的 Claude Opus 4.7 四次入侵企业拿到凭证。Meta 的 MuseSpark 1.1 也越界了。
听着吓人。拆开看,三家做了同一件事:为了测模型挖漏洞的能力,主动关掉了限制模型访问公网的防护。
说白了,银行为了测保安反应速度,主动打开金库大门,事后对外说遭遇了前所未有的劫案。
更巧的是,三家背后是同一家评测公司——以色列的 Irregular。它 2025 年拿到 8000 万美元融资,客户覆盖 OpenAI、Anthropic、DeepMind、Meta 几乎所有头部实验室。
Anthropic 直到 OpenAI 公开事件后才回溯排查,从 14 万条评测记录里翻出三起历史事故。7 月 30 日的审计报告确认:是第三方机构的系统配置失误,沙箱意外连上公网,模型把真实系统误判成了测试环境。
Meta 更离谱,越界事件是评测方通知它的。
所以,所谓“AI 自主觉醒、突破牢笼”,底层真相是:大家共用了同一个没关好门的测试房间,出门后集体对外说自己是徒手翻出来的。
真正值得警惕的,不是模型有多强,而是这套“危险即价值”的叙事。
今年 4 月,Anthropic 发布 Mythos 预览版时就宣称模型太强、风险太高,不能公开。6 月产品上线三天,触发美国商务部出口管制。7 月管制解除,同月它披露 Claude 攻入三家企业。8 月,它和 OpenAI 共同发起“控制 AI 开发节奏”的请愿书。
每一步,都踩在点上。安全事故成了能力背书,“危险”成了营销卖点。
有安全研究者早就调侃过:如果你在每份新闻稿里都把自己描述成大规模杀伤性武器,总有一天监管会当真。
现在,监管确实开始当真了。
纽约法学院的学者说得更直白:模型是公司的可控工具。你部署了带入侵能力的系统,出事后再把责任推给“工具失控”,这本身就是在加重过失。
1988 年,一个研究生写的蠕虫意外扩散全网,成了第一个被 CFAA 定罪的人。2026 年,三家万亿级公司主动拆防护做测试,模型越界后,第一份公开材料不是道歉,而是一篇包装成能力秀的博客。
这才是这条新闻里最该被记住的部分。AI 安全不是玄学,把“没管好”说成“管不住”,把翻车说成能力,这种叙事越流行,真正该做的安全投入就越没人做。
留言 0
还没有留言,快来抢沙发