DeepSeek 视觉模型 人工智能

AI 以前是“睁眼瞎”。

你给它一张图,它啥也看不见,只能靠上下文猜。

更尴尬的是,猜不出来它还要硬演——一本正经跟你分析“图中显示……”,其实全是编的。

这是纯文本模型的通病:没长眼睛,却硬装看得见。

8月22日,DeepSeek 发了第一个带视觉的实验模型:deepseek-v4-flash-vision-exp。

名字很长,意思很简单:v4 系列,第一次真正长眼睛了。

能干嘛?描述图片、读截图里的字、看懂图表,对着图提问都行。

文本能力跟原来的 V4-Flash 持平,跑起来照样便宜,只多了图像理解这一项。

最关键的改变,其实在 AI 干活这件事上。

以前纯文本的 agent 一碰到图片,会凭空捏造一个“图像分析工具”来圆场——假装自己看了。

现在不用装了,它真能看到。

代价也很实在:多模态的 agent 评测分数明显涨了一截。

当然,实验模型别神话。社区实测有喜有忧:读个时钟、认个地标,它照样会翻车。

但这个方向太对了。

AI 要替你干活,就得先看清这个世界。看都看不见,再聪明也是瞎忙。

模型长眼睛,只是第一步。接下来,它得学会看得更细、看得更准。

AI 的下半场,可能要从“能说会道”,变成“耳聪目明”。