
9月10日,DeepSeek又扔了个王炸。
新模型V4.1-Flash,正式上线。
552B参数,听着吓人。
但别慌——它每次干活,只激活8B。
相当于公司养着552个人,每次只叫醒8个。
钱,就是这么省的。
架构变了,成本直接砍半
这次用上了全新的Causal Encoder-Decoder架构。
读输入时8B参数开工,写输出时16B。
不对称设计,把算力花在刀刃上。
KV缓存也缩水了:890字节/token,只有上一代的四分之一。
对AI智能体来说这是天大的好事。
它们干活时反复读同一段代码、同一个文档,这部分开销直接消失。
性能不但没缩水,还反超了
DeepSWE编程测试74.2分。
GPT-5.6 Sol:73.0。Claude Opus 5:74.0。
平手,甚至略赢。
智能体基准Automation-Bench更是54.8对45.8,直接拉开一个身位。
100万token上下文,原生看图,推理力度可调。
你说它是个“小模型”?它明明干着旗舰的活。
价格,才是真正的核弹
错峰时段:输入0.15美元/百万token,输出0.6美元。
缓存命中更离谱:0.003美元/百万token。
对比一下:GPT-5.6 Sol输入4美元,Claude Opus 5输入5美元。
同一份活,V4.1-Flash便宜40倍。
40倍,不是四成,是四十倍。
更狠的是,9月14日起老V4-Pro流量自动切到新模型,API一行不用改。
老客户稀里糊涂就享受到了降价。
还开源了
权重MIT协议,HuggingFace直接下载。
想私有化部署?自己拿去跑。
数据不想出公司?没问题。
这场仗,变了
DeepSeek这个价格屠夫,把AI竞争的赛道从“谁的参数多”改成了“谁的成本低”。
当AI真的开始干活——写代码、管流程、处理文档——每美元能产出多少活,才是硬指标。
OpenAI和Anthropic跟不跟?
不跟,客户会跑。跟,利润会薄。
价格战,才刚刚开始。