阿里又打出一张牌:80B的模型,干活只唤醒3B,成本还砍掉九成

j
jxgzhc
3小时前 2 分钟阅读

通义千问 阿里大模型

阿里又打了一张牌。

9月12日,通义发布了新一代基础架构:Qwen3-Next,顺手还开了源。

名字听着普通,牌面不小。

总参数80B,每次干活只唤醒3B。

3B是什么概念?

别人的旗舰235B,全尺寸满血发力;它用个零头,把活儿干完了。

官方说,性能可以媲美自家235B的旗舰版。

重点不在参数,在账本。

训练成本,比同规模的密集模型Qwen3-32B,砍掉90%以上。

长文本推理,吞吐量提升10倍以上,百万token的超长上下文随便塞。

这是怎么做到的?

核心就俩字:稀疏。

800亿参数不是都要用,按需唤醒。外加一套混合注意力机制,把Transformer的老结构动了刀。

说白了,以前大模型拼“谁家参数多”,现在拼“谁家能把参数用出花”。

开源的诚意也足:指令版、推理版一起上,魔搭、HuggingFace都挂上了。

今天HuggingFace上,Qwen的衍生模型已经超17万个,全球第一。

这个数字背后是件更狠的事:

成本一旦被打下来,大模型就不再是少数巨头的游戏。

小团队,也能玩得起前沿模型了。

阿里这步棋,下的不是参数,是生态。

牌桌上,又多了一个卷法。