DeepSeek 视觉模型

DeepSeek给AI开了眼:能看图了,价格没变

DeepSeek出新模型了。

这次不是升级智商,是补眼睛。

8月21日,DeepSeek在API平台悄悄上线了一个实验性模型:deepseek-v4-flash-vision-exp。

名字很长,意思很简单:V4 Flash,第一次能看图了。

它能干啥?

看图说话,读截图里的字,分析图表,还能图片加文字混着聊。

对开发者来说,最有用的场景就俩:把截图变成结构化数据,把图表读成结论。

以前这件事得请专业的”视觉模型”,价格不便宜。

现在,DeepSeek用Flash的价格把这事干了。

图片按384个token算,跟上文token一起计费,价格沿用V4 Flash——一个字,便宜。

为啥这事值得说?

因为之前的V4 Flash,是个”看不见”的AI。

它没有视觉能力,但被问到”这张图里有什么”的时候,它不会承认看不见。

它会假装自己有工具,编一个”图像分析器”出来。

对,就是睁眼说瞎话。

现在眼睛装上了,这个问题根治了。

效果怎么样?

官方说,多模态Agent的综合表现,逼近Claude Opus-4.8。

注意,Claude Opus-4.8是各家都在对标的最贵旗舰。

DeepSeek用一个”Flash”(闪速版)就去够它了。

第三方跑了个叫DeepSWE的智能体测试,它拿了59.3%。

这数字看着一般?那是跟贵好几倍的对手比,才显得一般。

按性价比算,它是把”多模态Agent”这个本来高高在上的能力,拉到了人人都用得起的价位。

顺带一提,这次发布还免费开放了Files API:图片传一次,存个file_id,后面反复调用不用重复传图。

对于天天做”截图→数据”自动化的团队,省的不只是流量,是整条流程的复杂度。

说点掏心窝的话。

过去一年,AI拼的是”会不会说”——写代码、写文章、做推理。

这一波,开始拼”会不会看”了。

V4 Flash补上眼睛之前,AI聊天很聪明,但进了现实世界,它是个瞎子。

文档截图、网页报表、摄像头画面——这些才是真实工作里最多的输入。

一个既能看、又能想、又便宜的模型,才是真正能”干活”的AI,而不只是”聊天”的AI。

DeepSeek这一脚,把多模态Agent的门槛又踩低了一截。

想薅羊毛的开发者,可以动手了。

眼睛有了,价格没涨,剩下的就看谁能先把它用出花来。