DeepSeek视觉模型

多模态AI,一直是烧钱大户。

图片进模型,token哗哗地烧。一张图几百上千token,跨境做图、电商比价、文档扫描,成本算下来,能劝退一堆小团队。

DeepSeek这次直接掀桌子。

8月21日,它悄悄上线了个实验性模型:V4-Flash-Vision-Exp。名字很长,记住一句就够——看图和看文字,一个价。

图片按文本同样的token费率算钱,单张图token封顶384。

什么概念?以前多模态看图,图片token动辄上千。现在384封顶,还跟文字同价,成本直接砍到脚踝。

而且不是拿“能看图”当卖点的凑数货。1M上下文,一次最多塞600张图,截图、图表、扫描件、照片都能认。跑基准,部分项目已经贴近Claude Opus 4.8。

最关键的是兼容性:存量Agent框架直接能用,不用改代码。

这就有点狠了。

过去跨境SaaS、电商、文档处理的成本结构,很大一块卡在多模态调用的账单上。DeepSeek把视觉能力压进平价档,等于把这块成本直接抽干。

AI的“眼睛”,第一次这么便宜。

当一项能力贵到没人舍得用,它再强也是摆设;当它便宜到随手就能调,真正的玩法才会长出来。

DeepSeek这步棋,方向很明确:先把价格打下来,让更多人用得起,再用量换质。

AI视觉的下半场,可能要换了。