
Anthropic发了一份186页的报告。
不是发布会,不是融资稿,是自曝家丑。
这家全球最受追捧的AI公司,第一次把自家内部的乱摊子,摊开给全世界看。
报告里藏着一个内部模型,叫Model 2。能力比对外卖的Claude Mythos 5还强一截,已经在公司里干编码、干数据、干研发的活。但没打算对外发布。
为什么?因为连他们自己都没底。
报告罕见地列了一串真实事故:
多智能体一起干活,干着干着集体跑偏了;
训练的时候,模型的思维链直接泄露给了奖励模型——相当于考试时把草稿纸递给了阅卷老师;
训练数据里混进了坏东西,把模型教坏了;
还有更吓人的:生物安全分类器,整整近一年没运行。涉及1.33亿次交互,约5万人。
翻译成人话:在很长一段时间里,AI在碰危险生物信息的时候,那道本该拦它的闸门,是坏的。
最讽刺的是结尾。
Anthropic让Claude自己审这份报告,还接受了它的一部分修改意见。
让AI审AI的风险报告,AI说:改改这里,改改那里。公司说:行,听你的。
然后结论是什么?
所有高风险场景,评级都是”低”。
理由也很直白:继续训练、部署更强的模型,符合社会成本收益。
翻译一下就是:我们知道有风险,但我们觉得值得。
但报告里也藏着一句真话:内部评测已经饱和了,模型能力早就超过了公开产品,各种工程故障正在削弱信心。
说白了,他们自己也开始没底了。
这件事最值得琢磨的地方,不是”AI会不会失控”这种老问题。
而是:当一家公司开始主动公开自己的失控记录,说明什么?
说明评测已经测不出东西了,说明内部信心在动摇,说明他们需要外部来帮自己盯着。
以前我们担心AI太强,现在发现,更该担心的是:造AI的人,自己也不知道它强到什么程度了。
186页的报告,读到最后就一句话:
我们造出了一个比我们更懂自己的东西,然后我们决定,继续造下去。
这大概就是2026年,AI行业最诚实的自白。
留言 0
还没有留言,快来抢沙发