
8月6日,张一鸣在字节跳动Seed团队内部会议上说了一句话,很短,但分量很重。
“做模型要坚持长期主义,而不是用别人的输出,换一时的榜单排名。”
这句话翻译成大白话就是:别抄作业。
张一鸣平时很少在Seed团队会议上发言,这次却明确表态——字节跳动内部对开源模型严禁蒸馏,甚至用API检测等手段加强限制。
在大模型圈,”蒸馏”差不多是公开的秘密。拿别人训好的大模型当老师,用自己的小模型当学生,让”老师”替”学生”生成答案,然后学生照着学。效果好、成本低、出活快。很多榜单上的高分模型,背后就是这么来的。
但张一鸣说:不行。
为什么不行?因为蒸馏短期看是捷径,长期看是死路。用别人的模型蒸馏出的能力,本质上是寄生——人家一断供,你就抓瞎;人家一升级,你的”学生”就落后了。更重要的是,蒸馏过程本身不会产生任何原创性的技术积累,团队永远在追赶,永远在模仿,永远不知道自己差在哪。
张一鸣说字节”应该愿意为长期目标牺牲一部分短期收益”。这话放在字节这种体量的公司身上,不像是喊口号。字节今年国内对手开源模型迭代飞快,压力不小。但越是压力大,越容易走捷径,越需要有人按住刹车。
其实不止字节,整个中国AI行业都站在一个十字路口。
过去大半年,中国大模型进步神速——八周五连发、DeepSeek霸榜、千问3.8横扫基准测试。但光鲜的榜单背后,有多少是真正从零训出来的?有多少是站在别人肩膀上”微调”出来的?没人知道,也没人愿意说。
蒸馏不违法,技术上也没什么错。但当一个行业把”抄得快”当成核心竞争力,问题就来了。底层能力的缺失不会写在榜单上,但会在真正需要攻坚的时候暴露无遗——比如训练万卡集群的稳定性、长上下文的检索精度、复杂推理的一致性,这些都不是蒸馏能解决的。
张一鸣这次把话挑明了,不管别人怎么看,至少说明一件事:中国AI圈里,有人开始认真想”长线”这件事了。
不蒸馏,意味着更慢、更贵、更累。但也意味着你真的在造自己的轮子。
榜单排名可以换,底层能力换不来。
留言 0
还没有留言,快来抢沙发