只有3个关注者的”小透明”团队,两破AI训练世界纪录

j
jxgzhc
1天前 3 分钟阅读 1 阅读

AI大模型训练

人工智能芯片

AI圈昨天出了件特别”爽文”的事。

一个只有3个关注者的GitHub账号,连续两次拿下了大模型训练速度的世界纪录。

账号背后,是国产团队彩云科技,全职搞这套东西的,据说只有3个人。

先说这个比赛是啥。

NanoGPT Speedrun,通俗讲,就是大模型训练界的”奥运会”。

规则特别死板:统一用8张H100显卡,固定的数据集,训练一个1.24亿参数的GPT-2小模型,就看谁训练得最快。代码全部公开,成绩由社区大佬审核。

这个项目已经跑了两年多,训练时间被各路高手压得接近硬件理论极限。想再快几秒,光调参数已经没戏,得从模型底层结构动手。

彩云的两次突破,靠的就是这个”底层结构”。

第一次,他们提出了MUDD(多路动态稠密连接)。打个比方,传统模型的层与层之间像”固定管道”,信息只能按老路走。他们给模型装了一套”智能阀门”,让信息自己挑近路,决定往哪走、走多少。就这一下,训练时间从84.36秒压到了81.78秒。

一个多月后,他们又带来了DCMHA(可动态组合多头注意力)。传统模型里各个”注意力头”各干各的,互不通气。他们让这些”头”学会看内容下菜碟,按需组团。纪录从79.2秒一路刷到76.3秒——也就是1分16秒。

两次提交,两项原创架构创新,都发表在顶级会议ICML上(2024、2025两届),代码也都被官方仓库正式收下。

团队负责人自己都说,他们自称”AI小透明”。

可在海外技术圈,这个”小透明”掀起了真波澜。榜单核心维护者评价:这是”很长一段时间里最先进的提交之一”,还专门在社交平台转发点赞。

AI算力集群

这事最有意思的地方在哪?

不是1分16秒这个数字本身,而是它背后藏着一个行业转向的信号。

过去两年,AI圈拼的是算力、是参数规模,谁的卡多谁嗓门大。但这条路已经快到瓶颈——堆算力越来越贵,边际收益越来越小。

而彩云证明了另一种打法:不动硬件、不扩参数,靠把模型内部的信息流转机制做聪明,照样能挤出效率。用更少的资源,换更好的效果。

说白了,大模型竞争正在从”拼钱多”走向”拼脑子”。

当然,也得泼盆冷水。这个纪录目前只在小模型上成立,离万亿参数的商用大模型,中间还隔着十万八千里。但方向被验证了:底层结构的创新,确实能变成真金白银的效率。

有评论说得挺到位:大模型行业正进入新阶段,早期拼算力和参数,如今训练效率越来越关键,谁能用更少资源干出更好效果,谁就握住了下一个时代的入场券。

一个3人的”小透明”团队,干成了这件事。

技术演进史,从来不只由声量写成。