DeepSeek V4.1-Flash 新模型

9月10日,DeepSeek又扔了个王炸。

新模型V4.1-Flash,正式上线。

552B参数,听着吓人。

但别慌——它每次干活,只激活8B。

相当于公司养着552个人,每次只叫醒8个。

钱,就是这么省的。

架构变了,成本直接砍半

这次用上了全新的Causal Encoder-Decoder架构。

读输入时8B参数开工,写输出时16B。

不对称设计,把算力花在刀刃上。

KV缓存也缩水了:890字节/token,只有上一代的四分之一。

对AI智能体来说这是天大的好事。

它们干活时反复读同一段代码、同一个文档,这部分开销直接消失。

性能不但没缩水,还反超了

DeepSWE编程测试74.2分。

GPT-5.6 Sol:73.0。Claude Opus 5:74.0。

平手,甚至略赢。

智能体基准Automation-Bench更是54.8对45.8,直接拉开一个身位。

100万token上下文,原生看图,推理力度可调。

你说它是个“小模型”?它明明干着旗舰的活。

价格,才是真正的核弹

错峰时段:输入0.15美元/百万token,输出0.6美元。

缓存命中更离谱:0.003美元/百万token。

对比一下:GPT-5.6 Sol输入4美元,Claude Opus 5输入5美元。

同一份活,V4.1-Flash便宜40倍。

40倍,不是四成,是四十倍。

更狠的是,9月14日起老V4-Pro流量自动切到新模型,API一行不用改。

老客户稀里糊涂就享受到了降价。

还开源了

权重MIT协议,HuggingFace直接下载。

想私有化部署?自己拿去跑。

数据不想出公司?没问题。

这场仗,变了

DeepSeek这个价格屠夫,把AI竞争的赛道从“谁的参数多”改成了“谁的成本低”。

当AI真的开始干活——写代码、管流程、处理文档——每美元能产出多少活,才是硬指标。

OpenAI和Anthropic跟不跟?

不跟,客户会跑。跟,利润会薄。

价格战,才刚刚开始。