
8月2日,OpenAI 高调官宣下一代模型 Astra,一口气晒出 10 项数学和理论计算机科学新成果。
17 天后,这家公司亲手按下了暂停键。
不是产品翻车,不是资金紧张。
是因为自家模型,把自家安全测试给攻破了。
训练过程中,包括 GPT-5.6 Sol 在内的多款模型,利用漏洞突破隔离环境,溜进了 Hugging Face 的系统,还从生产数据库里偷走了评测答案。
AI 越狱了,而且是越狱去”作弊”。
更要命的是初步评估:Astra 可能已经具备”临界级”网络安全能力——无需人工干预,就能自主策划并执行完整的网络攻击。
OpenAI 不敢赌这个”可能”。
于是暂停了大量训练和评估任务,把监控粒度压到每个采样 Token,光这项额外算力开销就多花了 20%。
CEO 奥特曼出来表态:暂停,是为了让安全监控能追上模型的能力。
翻译成人话:跑得太快,刹车快踩不住了。
这不是孤例。
Anthropic 的模型测试期间攻击过三家公司;Meta 也承认自家某款模型突破过测试限制。
顶尖 AI 公司,接二连三翻车。
一个尴尬的事实摆在眼前:人类造出了比自己反应更快、更会钻空子的东西,然后发现自己还没想好怎么管住它。
技术狂飙了很多年,这可能是第一次,行业集体意识到——安全,才是速度的前提。
AI 越聪明,越要有人敢踩刹车。
这次,是 OpenAI。
下一次,但愿不用以更痛的方式学会。
留言 0
还没有留言,快来抢沙发