8MB的AI模型,凭什么敢对标DeepSeek V4 Flash?

正文:

一个只有8MB的模型,官方说它能对标DeepSeek V4 Flash。

这不是段子,是Cactus刚发布的Needle3。

8MB是什么概念?一张手机照片原图可能都比它大。以前这种体积的模型,基本只能做做关键词匹配,干不了正经事。

但Needle3的路子不一样。

它不陪你聊天,它负责干活。

准确说,它把”帮我订明天下午三点的会议室”这种话,直接翻译成一段结构化函数调用,让系统照着执行。不写诗、不抒情、不谈人生,就老老实实把指令变成代码。

这恰恰是端侧AI最需要的本事。

端侧场景里,模型的第一要务不是聪明,而是准。100MB的模型在云端跑得飞起,到了手机、耳机、智能家居里,连装都装不下。

Needle3给的解法是:可切片。

同一套权重,从2层到20层随便切,参数规模25M到121M浮动,量化压到CQ2-bit。开发者按设备算力现切现用,不用重新训练,不用维护多套模型。

最小8MB,最大29MB。

这个思路挺聪明——与其把模型做大塞进设备里,不如让模型学会自己瘦身。

当然,它能不能真的对标DeepSeek V4 Flash,还得实测说话。但”8MB”这个数字本身,已经把端侧自动化的想象空间撬开了一条缝。

模型越来越小,能干的活越来越多。

这大概才是端侧AI该有的样子。