AI芯片 GPU 代码优化

AI写代码不稀奇了。但”写对”和”写快”,是两码事。

很多大模型能写出语法正确的CUDA代码——那是让GPU干活用的底层语言。但一跑起来就露馅:慢。

慢到什么程度?字节的Seed1.6,跑基准测试,74%的任务能写对。但只有27%的代码跑得比编译器快。平均下来,还不如编译器自己生成的。

这个月,字节跳动Seed团队和清华AIR,直接给AI上了套”实战训练”。

AI 芯片电路板

他们把大模型扔进真实的GPU开发环境,让它自己写、自己跑、自己测,不对就改。没有标准答案,只有一条硬规矩:写得没编译器快,就不算数。

练了150步,效果出来了——

250个任务,通过率98.8%。96.8%的代码,跑得比官方编译器还快。平均提速2.1倍。

最狠的是最难的那批题。AI写出来的代码,比硅谷最顶级的闭源模型Claude Opus 4.5和Gemini 3 Pro,快了整整40%。

这套系统的名字很朴素,叫CUDA Agent。

它干的活,以前靠的是人。什么人?全球能把GPU底层代码优化到极致的工程师。圈内人都知道,这帮顶尖高手,加起来凑不满半个会议室。

英伟达最硬的护城河,从来不是芯片,是这帮”手艺人”写出来的软件生态。别的芯片厂商想追,先得凑齐一批能跟英伟达工程师硬刚的人——钱花得起,人凑不齐。

现在,AI来了。用无限并发的智能体,一遍一遍地在真实硬件上试错、优化。

虽然CUDA Agent的完整模型还没开源,但数据集、训练配方都放出来了。等于把”打法”公之于众。

当AI开始替硬件”重写灵魂”,算力世界的游戏规则,可能真要变了。

对于吃瓜的我们,记住一件事就行:以后跑AI的速度,可能不是取决于芯片多快,而是取决于AI自己把代码优化得多好。