
见过开源的模型。也见过代码、数据、权重全公开的模型。
但你见过“直播训练过程”的大模型吗?
斯坦福教授 Percy Liang 干了一件大事:他的 Marin 实验室,开始公开训练一个 5350 亿参数的 MoE 大模型。三个月,18.75 万亿 token,792 块英伟达 GB200 显卡。
听起来又是一次“烧钱训练”?关键是过程。训练配置、损失曲线、数据组成,全部实时公开。怎么试错、怎么改、哪次失败了,都有记录。外人可以像盯 GitHub 项目一样,围观一场 535B 模型的训练全程。
这搁以前想都不敢想。各家大厂把训练当命根子捂着,能给你看的只有最后那版权重。你看到“结果”,看不到“过程”:为什么这么调参、哪次实验翻车了、中间改过什么。就跟只看成品菜、不给菜谱似的。
Marin 搞的是“开放实验室”:每个实验先在 GitHub 上立 Issue,讲清楚要试什么、赌什么;配置用 Pull Request 提交,同行可以来 review;开跑之后,训练指标全公开,连失败实验都留痕。
这套玩法不是没人试过。BLOOM、Pythia、OLMo 都开放过数据、代码、检查点。但 Marin 往前多迈了一步:把“为什么这么练、怎么改的”整个思考过程,也摆上了台面。
消息一出,Percy Liang 的帖子浏览量突破 80 万。吴恩达亲自转发,说这是当下 AI 开源里难得的“珍贵示范”——不只是公开模型代码,连数据、训练配方、实验过程都摊开给你看。
有个点值得琢磨:开源这件事,以前比的是“谁给得多”,现在是“谁给得真”。给权重,是把饭做好端你面前;连训练过程都公开,是把菜谱、火候、翻车记录全给你——这是把“吃饭的人”变成“能上手做饭的人”。
大模型圈,第一次有人把“炼丹炉”搬到了大街上。不管最后这个 535B 练出来强不强,光是“过程能看”,就已经是行业头一回了。
留言 0
还没有留言,快来抢沙发