DeepSeek 悄悄上新:V4.1 Flash 发布,算力焦虑终于有解了?

DeepSeek 悄悄上新:V4.1 Flash 发布,算力焦虑终于有解了?
9月10日,DeepSeek 正式发布了 V4.1 Flash。
没有发布会,没有大张旗鼓的宣传。但懂行的人已经注意到了:这一次,DeepSeek 瞄准的不是”谁能打”,而是”谁更省”。
先说参数。552B 的主干 MoE 架构,听着吓人,但真正厉害的是”激活”逻辑——输入阶段只激活约 8B 参数,输出阶段约 16B。什么意思?就是这头大象干活的时候,只用了一小块肌肉。
更狠的是 KV Cache 的压缩。对比上一代 Flash,模型对 HBM 和 SSD 的资源需求,分别压缩到约 1/4 和 1/8。
这四个数字,才是这次发布真正的信号:大模型竞争,从”堆参数”正式转向”抠成本”。
为什么要这么抠?
因为 AI 的下一站,是 Agent。
过去一年,各家都在推 Agent 概念:让 AI 自己拆任务、调工具、多轮执行。听着很美,但真实场景里,Agent 是”吃 token 大户”。长上下文、频繁工具调用、多轮迭代,每一轮都在烧钱。
V4.1 Flash 就是冲着这个来的。它把上下文处理、推理资源占用全部压了一遍,专门优化”长任务”场景。翻译过来就是:Agent 跑得动、跑得久、还跑得起。
有行业人士算过一笔账:在代码开发、研究分析、企业办公这类需要反复读材料、反复调工具的场景里,单位任务的成本在肉眼可见地下降。
这也解释了 DeepSeek 的一贯打法——不跟你拼营销,就拼性价比。从 V3 到 V4,再到今天的 V4.1 Flash,路线从来没变过:把价格打下来,把门槛降下来。
当然,这不是 DeepSeek 一家的事。整个行业的共识已经形成:模型能力差距正在收窄,成本才是决定商业化的胜负手。谁能让企业用得起、用得久,谁就能吃到 Agent 时代最大的红利。
V4.1 Flash 只是一个开始。真正的看点在于:当 Agent 大规模跑起来之后,谁的基础设施最省钱,谁就握住了下一轮竞争的钥匙。
这一次,DeepSeek 又走在了前面。