
8月1日,DeepSeek-V4-Flash正式版API上线。
参数没变。2840亿总参,130亿激活,和预览版一模一样。
但能力变了。而且变得很离谱。
最夸张的数字是DeepSWE——一个衡量AI做长周期编程能力的基准。预览版7.3分,正式版54.4分。
翻了将近6倍。
同一个骨架,同一个模型,只是重做了一遍后训练。什么都没加,就是把训练方法优化了一下。
这事细想起来挺吓人的。
过去两年,大模型圈所有人都在卷参数。你有1000亿,我就要2000亿。你2000亿,我搞4000亿。军备竞赛一样的逻辑——更大就是更好。
DeepSeek这次直接把桌子掀了。
它告诉你:你的模型可能根本没发挥出真正实力。你花几亿美元堆出来的参数,一大半在摸鱼。真正决定模型能力的,是后训练阶段怎么调教它。
这相当于什么?你买了一辆法拉利,但一直挂在一档开,然后旁边有人告诉你:兄弟,这车其实有六个档。
Terminal Bench 2.1跑到了82.7分,也是同类模型里最顶的。不是靠堆参数堆出来的,是靠更聪明地训练出来的。
这件事对整个行业意味着三件事:
第一,参数竞赛的遮羞布被扯掉了。以后再拿”我们模型参数量最大”出来说事,别人可以回一句:DeepSeek参数没变,能力翻了6倍,你怎么看?
第二,后训练成了新战场。预训练烧钱,后训练更烧脑。以前大家觉得把模型”生”出来就差不多了,现在发现”养”才是真功夫。
第三,小团队的机会来了。如果同样的骨架靠后训练就能质变,那意味着不需要从头训一个超大模型也能做出顶级产品。算力门槛在降低。
这才是DeepSeek V4-Flash最值得关注的地方。不是它又多强,而是它证明了:大模型竞赛的上半场结束了。
上半场比谁力气大,下半场比谁会用力。
留言 0
还没有留言,快来抢沙发