阿里又打出一张牌:80B的模型,干活只唤醒3B,成本还砍掉九成

阿里又打了一张牌。
9月12日,通义发布了新一代基础架构:Qwen3-Next,顺手还开了源。
名字听着普通,牌面不小。
总参数80B,每次干活只唤醒3B。
3B是什么概念?
别人的旗舰235B,全尺寸满血发力;它用个零头,把活儿干完了。
官方说,性能可以媲美自家235B的旗舰版。
重点不在参数,在账本。
训练成本,比同规模的密集模型Qwen3-32B,砍掉90%以上。
长文本推理,吞吐量提升10倍以上,百万token的超长上下文随便塞。
这是怎么做到的?
核心就俩字:稀疏。
800亿参数不是都要用,按需唤醒。外加一套混合注意力机制,把Transformer的老结构动了刀。
说白了,以前大模型拼“谁家参数多”,现在拼“谁家能把参数用出花”。
开源的诚意也足:指令版、推理版一起上,魔搭、HuggingFace都挂上了。
今天HuggingFace上,Qwen的衍生模型已经超17万个,全球第一。
这个数字背后是件更狠的事:
成本一旦被打下来,大模型就不再是少数巨头的游戏。
小团队,也能玩得起前沿模型了。
阿里这步棋,下的不是参数,是生态。
牌桌上,又多了一个卷法。