AI芯片

AMD最近干了一件狠事:收购了多伦多一家叫Taalas的初创公司。

这家公司有个绝活——不把模型从内存里读出来,而是直接把模型权重”刻”进硅片里。

听起来像玄学,但效果很炸裂。

Taalas的HC1芯片跑Llama 3.1 8B模型,每秒能处理16960个token,比英伟达GPU快了整整48倍。

48倍是什么概念?别人还在排队等显卡算,它已经算完了。

但天下没有免费的午餐。这种芯片有个硬伤:模型是刻死的,换一个模型就得换一块芯片。

也就是说,它不通用。英伟达的GPU是”万金油”,什么模型都能跑;Taalas是”定制款”,只认一个模型。

这背后其实是AI芯片的两条路线之争:

一条是英伟达的通用路线——一块卡跑所有模型,靠规模摊薄成本。

另一条是Taalas的专用路线——把模型焊死在芯片上,用极致效率换极致速度。

AMD这一手,等于在英伟达的地盘上插了一面旗:你卖通用,我卖专用,看谁先跑通。

对普通人来说,这事离我们很远。但往深了想,它说明一个趋势:AI的算力战争,已经从”拼显卡数量”进入”拼芯片效率”的阶段了。

当模型被刻进硅片,AI的边际成本会低到难以想象。到那时候,AI才真正算得上”水电煤”。

这场仗,才刚刚开始。