
多模态AI,一直是烧钱大户。
图片进模型,token哗哗地烧。一张图几百上千token,跨境做图、电商比价、文档扫描,成本算下来,能劝退一堆小团队。
DeepSeek这次直接掀桌子。
8月21日,它悄悄上线了个实验性模型:V4-Flash-Vision-Exp。名字很长,记住一句就够——看图和看文字,一个价。
图片按文本同样的token费率算钱,单张图token封顶384。
什么概念?以前多模态看图,图片token动辄上千。现在384封顶,还跟文字同价,成本直接砍到脚踝。
而且不是拿“能看图”当卖点的凑数货。1M上下文,一次最多塞600张图,截图、图表、扫描件、照片都能认。跑基准,部分项目已经贴近Claude Opus 4.8。
最关键的是兼容性:存量Agent框架直接能用,不用改代码。
这就有点狠了。
过去跨境SaaS、电商、文档处理的成本结构,很大一块卡在多模态调用的账单上。DeepSeek把视觉能力压进平价档,等于把这块成本直接抽干。
AI的“眼睛”,第一次这么便宜。
当一项能力贵到没人舍得用,它再强也是摆设;当它便宜到随手就能调,真正的玩法才会长出来。
DeepSeek这步棋,方向很明确:先把价格打下来,让更多人用得起,再用量换质。
AI视觉的下半场,可能要换了。
留言 0
还没有留言,快来抢沙发