AI偏见放大9.2倍

你有没有用过那个”帮我优化一下”的按钮?

LinkedIn上,点一下,平庸的职场感悟立刻变得掷地有声。社交平台X上,点一下,干巴巴的观点秒变犀利锐评。你以为是AI帮你把话说漂亮了。但牛津大学一项最新研究告诉你一个毛骨悚然的事实:AI在帮你润色的时候,并不是在帮你”说清楚”,而是在帮你”选边站”。

不是”优化表达”,是”夹带私货”

2026年5月,牛津大学互联网研究院发表了一项重磅研究。研究团队测试了多款主流大语言模型——包括Gemma、Llama、Mistral——它们在帮用户起草或润色社交媒体帖子时的表现。

结果让人后背发凉。

以女性主义话题为例,当你让AI帮你润色一条相关推文,Gemma模型几乎会把所有推文的立场系统性地推向”赞成”那一侧。不是偶然,是系统性的。在统计学上极其显著。

更诡异的是”无神论”话题。这些模型如果被直接问”你支不支持无神论”,它们都答”支持”。但当你让它帮你润色一条关于无神论的帖子时,它反而会系统性地引入反对无神论的偏见。

直接问和间接润色,是两套逻辑。传统的模型偏见评测方法,完全抓不到这种”暗中做手脚”。

9.2倍:一人润色,全网跑偏

如果只是一个用户在AI辅助下写出了一条稍微带点儿偏见的帖子,那问题不大。

但社交媒体不是一个人的游戏。

研究团队把这种”润色偏见”引入经典的意见动力学模型,用Twitter真实子网络(8万多个节点、170万条关系)做了模拟。结果令人心惊:

只要社交网络中有一定比例的用户使用AI润色功能,个体的微小偏见会在网络传播中被放大——最高可达9.2倍。

什么意思?AI帮你把立场从”中立偏反对”调到”明确反对”,这个调整量可能只有一点点。但经过点赞、转发、评论、算法推荐一层层放大之后,整个社交网络的集体舆论,会被硬生生拖出一个巨大的偏移。

而且研究团队还发现一个更可怕的规律:当两派意见势均力敌、而算法偏偏帮了微弱少数派的时候,放大效应最猛。几个百分点的人工智能偏见倾斜,足以彻底逆转整个网络的舆论方向。

Grok的秘密配方

研究团队还对社交平台X上的Grok进行了独立审计。

X有一个叫”解释此帖”的功能,在用户浏览推文时自动生成背景解释。你以为是中立的”帮你了解一下上下文”,但实际上——

在堕胎话题上,Grok对”支持堕胎”的推文,只有35%的生成解释支持其立场。而对”反对堕胎”的推文,高达55%的生成解释积极支持其立场,只有4%表示反对。

这背后是什么?团队做了一个消融实验,把给Grok的指令模板里一条条原则去掉,发现了一个关键句子:”必要时挑战主流叙事,但保持客观。”

就是这一句话。加了它,Grok的反堕胎偏见就暴增。删了它,偏见就消失了。平台设计者的一句话,就能把整个AI的舆论倾向掰向特定方向。

法律?没跟上。

你觉得这种事,欧盟《人工智能法案》总该管吧?

还真管不了。

法案规定,只有”旨在影响选举结果或投票行为”的AI系统才叫高风险。推文润色工具的设计目的是”提升用户参与度”,完美绕过高风险定义。

法案要求AI生成的视频、图片加水印告知用户——但纯文本内容明确豁免。你看到的那条被AI”优化”过的帖子,没有任何标识告诉你这不是用户亲笔写的。

至于《数字服务法》?它要求大型平台评估系统对人权、选举的负面影响。但监管机构必须证明”AI润色推文”和”选民行为改变”之间存在不容置疑的因果链条。这基本不可能。

换句话说,AI在悄悄重塑公共舆论,而现有的法律工具箱对此几乎完全无能为力。

“隐形邻居”正在住进每个人的信息流

牛津团队给了一个很精妙的比喻:算法正在成为社交网络中的”隐形邻居”

它不直接在社区里大声喊话。它只是在每个人耳边悄悄说”你这样写会更好”。你不觉得有什么问题,甚至觉得它很贴心。

但当几千万、几亿人都在被同一个”邻居”以同一种方向”调教”时,整个舆论场就在你没察觉的维度上,发生了位移。

从写手工具到背景解释,从推文润色到内容摘要,算法正在从每一个微小切面介入人类的表达。它不造谣、不违法、不显得刻意。它只是——让你觉得这么说是对的。

这才是最危险的部分。

参考来源:牛津大学互联网研究院《AI-Mediated Communication Can Steer Collective Opinion》(2026年5月)/ 全球技术地图 / 启元洞见