DeepSeek视觉理解模型

8月21日,DeepSeek悄悄上线了一个新模型:deepseek-v4-flash-vision-exp。

名字很长,意思很简单——这是V4系列第一个能”看图”的模型。

以前DeepSeek只认字。截图、图表、网页、拍的照片,它都看不懂。

现在能了。看截图、读文档、分析图表、理解网页界面,都能搭上Agent干活。

最狠的一点是:加眼睛,不加价。

价格和V4-Flash一模一样。一张图最多折算384个token,高峰期算下来,看一张图大概1厘钱。

一千张图,也就一块多。这一块多,在Opus 4.8那边,可能只够按几下快门。

能力也不虚。

DeepSeek自己跑了11项基准,赢了3项,剩下的差距也不大。多模态Agent能力,官方口径是”接近Opus 4.8″。

关键是不掉链子:加了视觉,纯文本能力和V4-Flash持平,一个字都没缩水。

DeepSeek AI

对开发者的意义,比参数有意思。

以前用DeepSeek做Agent,是”看”和”想”分开的:别人负责看,它负责想,中间还要对接别的视觉模型。

现在闭环了。它自己看、自己理解、自己推理、自己调工具干活。DeepSeek一起上线的免费Files API,同一张图传一次,之后随便引用,不再重复上传。

一句话总结它的打法:性能对标最强,价格打骨折。这次连”眼睛”都用最便宜的方式装上了。

AI”看图”这件事,可能要从此变成白菜价。