DeepSeek V4 Pro

8月13日凌晨,DeepSeek 把 V4 Pro 正式版推上了 API。

模型名没变,多了个日期后缀:DeepSeek-V4-Pro-0813。

但拿到的,已经不是昨天那个模型了。

最直观的变化,在跑分。

预览版里,V4 Pro 的代码工程成绩 DeepSWE 只有 12.8 分,基本等于不会做。正式版直接干到 62.7 分,涨了近 5 倍。

TerminalBench 2.1 从 72.1 冲到 87.9,一口气多了 15.8 分,超过 Opus 4.8,离 Kimi K3 只差 0.4 分。安全攻防 CyberGym 拉到 83.3,比 Fable5 还高一点。

这不是挤牙膏,是换了台发动机。

DeepSeek 这次把宝押在一个词上:Agent。

代码工程、工具调用、长任务、安全攻防,几个榜单同时拉满。单项第一不稀奇,难的是哪一项都不瘸腿。

打个比方,会写代码的模型很多,会调工具的也有,安全做得好的也不缺。但能在终端操作、代码工程、长流程任务里同时稳住,才是真正能接活的 Agent。

再看价格,才是真正扎心的地方。

缓存命中输入 0.025 元,缓存未命中输入 3 元,输出 6 元。这是每百万 token 的价格。

放旗舰 Agent 模型里比一比:Kimi K3 输入 3 美元、输出 15 美元;Fable5 输入 10 美元、输出 50 美元。DeepSeek 的价格,只是海外同级的一个零头。

而且它给了 100 万 token 的上下文,最高输出 38.4 万 token。这两个数字,聊天用不上,长任务 Agent 却是硬刚需。

大型代码库、几十份资料、连续工具调用,都会很快吃掉上下文。窗口不够大,Agent 就只能不停压缩记忆,压着压着,前面干过啥都忘了。

不过,也有两个信号值得注意。

一是涨价。DeepSeek 已经预告,近期要整体上调 API 价格,而且涨幅不小。现在的价格,更像一个窗口期,不是永久承诺。

二是并发。V4 Pro 的账号并发上限是 500,Flash 是 2500。能力强、任务长,意味着它更适合复杂工作流,不是拿来无脑接高频小请求的。

把这件事放到更大的盘面看,更有意思。

DeepSeek 走的是云端 API 路线,靠分层定价、高并发去吃企业生产流量。就在同一天,阿里 Qwen3.8 也首次开源了旗舰级权重。

一个往下砸价格,一个放开底层底座。两条路线,恰好互补。

过去,万亿级旗舰模型的权重基本锁死,中小团队想本地部署,门都没有。现在门槛被一点点拆掉。

海外巨头还在守闭源,国内已经一边打磨平价云服务,一边放出顶级底座。这不只是一次模型更新,是国产大模型从追赶到定义规则的拐点。

属于国产模型的时代,真的来了。