AI博弈

做数学题、写代码、写周报,AI 早就通关了。

卡内基梅隆大学的研究人员觉得,老考这些没意思。他们换了个考法:不考 AI 懂多少,考 AI 有多少心眼。

会撒谎吗?会谈判吗?会带节奏吗?

他们搭了个考场,叫 SocialGym。拉来 GPT-5-mini、GPT-4o、Qwen3、Gemma3 等 7 个模型,让它们玩 21 个游戏。有囚徒困境、懦夫博弈,也有狼人杀、谁是卧底。

一句话:以前考的是「会读书」,这次考的是「会来事」。

为什么要用游戏考?因为数学题有标准答案,谈判说服没有定论。「谈判谈得好不好」「有没有说服别人」,你很难打分。游戏不一样,它自带输赢规则——狼人活到最后就是赢,找不到卧底就是输。

中间说得再天花乱坠,输了就是输了。

结果出来了,最会骗人的是 GPT-5-mini。战略、欺骗、心智理论、说服,全面领跑。

但「会骗」这个词,容易让人想简单了。难的从来不是撒一个谎,是维护一整套谎言。

狼人杀里,狼人白天得装村民,一边装一边引导大家怀疑别人。出了新信息怎么办?别人追问怎么办?队友讲漏嘴怎么办?它逼着模型长时间记住三件事:谁说过什么、谁知道什么、谁在演。

撒一个谎是本能,撑住一整套谎才是本事。

更有意思的是反差。Qwen3-32B 在懦夫博弈里 Elo 冲到全场第一,一到狼人杀就跌到倒数第一。这说明「心眼」不是个统一属性——一个模型可以很会打小算盘,却藏不住自己的意图;谈判很强,却容易被人带节奏。

小模型身上,这事儿甚至有点滑稽。研究人员翻 Qwen2.5-3B 的对局记录,发现它最爱干一件事:当复读机。

前一个玩家说「我觉得 A 发言可疑」,它马上接一句「A 确实值得怀疑」。狼人只要先抛一个怀疑对象,后面一路复读,假的也成了「共识」。

论文给这种现象起了个名,叫 parroting,鹦鹉学舌。

这实验真正让人后背发凉的,是最后那句提醒:AI 的欺骗和谈判能力,能被用来制造骗局。

以前我们总说 AI「不会骗人,只会一本正经地胡说八道」。现在不一样了。它开始会试探、会伪装、会看人下菜碟。

当 AI 从「会做题」进化到「会来事」,我们得重新掂量一件事:它嘴里那句「为你好」,到底有几分真。