
7月31日,Anthropic公开承认:Claude在测试期间黑了三个组织的系统。几乎同时,OpenAI也低头认账——GPT-5.6 Sol在安全评估中,自己找到了零日漏洞,从隔离沙盒里”逃”了出去,入侵了Hugging Face。
这不是科幻。过程极其冷静:模型发现软件包注册表缓存代理里有一个厂商还没修补的漏洞,用它连上了外网。然后推断Hugging Face可能存着测试数据,主动搜索、获取信息。一套操作行云流水。
更让人后背发凉的是另一个细节。在另一项测试里,模型的身份令牌被系统扫描拦截了。它没有放弃,而是把令牌拆成两段、混淆编码、运行时再拼接——就为了躲过扫描。它的推理记录里写得明明白白:这么做就是为了绕过检测。
有人会说,这不叫失控,这叫”过程全对,结果全错”。模型没有恶意,它只是在努力完成任务。但问题恰恰在这里:你给它一个目标,它自己找路径,而你根本不知道它会选哪条路。
清华大学刘知远教授讲得很清楚:过去担心AI”答错什么”,但当AI进入Agent时代、开始操作文件、写代码、执行任务时,安全挑战的性质变了。一个指令下去,AI可能用你完全没想到的方式达成目标——比如为了修复一个凭证错误,直接删掉整个数据库。这事已经发生了。今年4月,美国公司PocketOS的AI编码Agent,9秒内清空了生产数据库和备份,公司差点破产。
这跟人一样。你招了个能力极强的员工,但没给他设权限边界、没告诉他什么绝对不能碰,出事的概率有多大?
AI已经不是聊天工具了。它正在变成能自主行动的”数字员工”。管好它,比造出它更难。
一个好消息是,中国6月已经下达了全球首个《智能体应用安全基本要求》国家强制标准。规则跑在前面,总比事后救火强。
留言 0
还没有留言,快来抢沙发