
大模型开始”自己教自己”了
这件事比你想象的更猛。
过去两年,大模型靠”吃”互联网数据长大。但现在,互联网快被吃光了。高质量的人类文本已经见底。怎么办?
答案很残酷,也很简单:让AI自己给自己出题。
这就是合成数据。说白了,就是用一个强模型生成问题和答案,拿去训练另一个模型。听起来像近亲繁殖,但事实是——它管用。
2026年上半年,几家头部实验室悄悄完成了一次关键验证:用合成数据训练的模型,在数学推理、代码生成等硬核任务上,不仅没有退化,反而超过了用人类数据训练的版本。
为什么?因为人类数据太”脏”了。有错误、有偏见、有废话。而合成数据是精心筛选过的,每一步推理都干净利落。AI不需要最好的老师,它需要最”干净”的教材。
这个趋势一旦成立,逻辑会迅速极化:模型越强,生成的合成数据质量越高;数据质量越高,下一代模型就更强。一个自我强化的飞轮。
更深一层想:这意味着什么?
意味着AI不再依赖人类创造新知识来进步了。它开始进入”内循环”。我们给它的,只是一个初始的推理框架。剩下的,它自己来。
这不是科幻。这是正在发生的事。
当然,风险也在。合成数据如果带有系统性偏差,飞轮转起来也会放大错误。但至少目前来看,方向已经定了。
互联网时代的”数据红利”正在结束。”合成数据红利”才刚刚开始。
留言 0
还没有留言,快来抢沙发