DeepSeek的V4.1 Flash:还在卷参数的大模型,这一局输了

AI圈这几天最热闹的消息,是DeepSeek悄悄发了个新模型:V4.1 Flash。
名字挺低调,事不小。
一句话概括:这个”最小”的新模型,跑分、速度、成本,全把自家旗舰V4 Pro摁在地上摩擦。旗舰直接宣布退休——9月14号起,所有调用deepseek-v4-pro的请求,自动切到V4.1 Flash。
很多人没看懂这背后的信号。
先说参数。552B参数的MoE架构,听着还是个大块头。但注意激活参数:读请求只激活8B,生成时16B。也就是说,平时真正用到的”本事”,只有满血的几十分之一。以前是十个专家一起上阵,现在最多俩,活儿照样干得漂亮。
更狠的在KV Cache。这东西是长上下文和Agent任务里最烧钱的部分——AI跑Agent任务要反复”回忆”之前的对话,每回忆一次都要掏钱。
V4.1 Flash把这块砍了:显存占用只要老款的四分之一,存储只要八分之一。缓存命中成本,从”贵”变成”白菜价”。
懂行的人已经嗅到风向:大模型的竞争,从拼参数,变成拼架构了。
海外巨头还在堆料,DeepSeek换了一条路——用非对称的因果编码-解码架构,把”输入便宜、输出聪明”做到极致。这不只是技术迭代,是成本结构上的降维打击。
对普通用户,别管那些技术名词,记住一句就够:
以前,AI聪明但贵,老板嫌贵。现在,又聪明又便宜,老板没有理由不让你用。
当聪明的AI便宜到白菜价,Agent批量干活的时代,才算真正开始。