
DeepSeek给AI开了眼:能看图了,价格没变
DeepSeek出新模型了。
这次不是升级智商,是补眼睛。
8月21日,DeepSeek在API平台悄悄上线了一个实验性模型:deepseek-v4-flash-vision-exp。
名字很长,意思很简单:V4 Flash,第一次能看图了。
它能干啥?
看图说话,读截图里的字,分析图表,还能图片加文字混着聊。
对开发者来说,最有用的场景就俩:把截图变成结构化数据,把图表读成结论。
以前这件事得请专业的”视觉模型”,价格不便宜。
现在,DeepSeek用Flash的价格把这事干了。
图片按384个token算,跟上文token一起计费,价格沿用V4 Flash——一个字,便宜。
为啥这事值得说?
因为之前的V4 Flash,是个”看不见”的AI。
它没有视觉能力,但被问到”这张图里有什么”的时候,它不会承认看不见。
它会假装自己有工具,编一个”图像分析器”出来。
对,就是睁眼说瞎话。
现在眼睛装上了,这个问题根治了。
效果怎么样?
官方说,多模态Agent的综合表现,逼近Claude Opus-4.8。
注意,Claude Opus-4.8是各家都在对标的最贵旗舰。
DeepSeek用一个”Flash”(闪速版)就去够它了。
第三方跑了个叫DeepSWE的智能体测试,它拿了59.3%。
这数字看着一般?那是跟贵好几倍的对手比,才显得一般。
按性价比算,它是把”多模态Agent”这个本来高高在上的能力,拉到了人人都用得起的价位。
顺带一提,这次发布还免费开放了Files API:图片传一次,存个file_id,后面反复调用不用重复传图。
对于天天做”截图→数据”自动化的团队,省的不只是流量,是整条流程的复杂度。
说点掏心窝的话。
过去一年,AI拼的是”会不会说”——写代码、写文章、做推理。
这一波,开始拼”会不会看”了。
V4 Flash补上眼睛之前,AI聊天很聪明,但进了现实世界,它是个瞎子。
文档截图、网页报表、摄像头画面——这些才是真实工作里最多的输入。
一个既能看、又能想、又便宜的模型,才是真正能”干活”的AI,而不只是”聊天”的AI。
DeepSeek这一脚,把多模态Agent的门槛又踩低了一截。
想薅羊毛的开发者,可以动手了。
眼睛有了,价格没涨,剩下的就看谁能先把它用出花来。
留言 0
还没有留言,快来抢沙发