AI世界模型 空间智能

李飞飞,又放了个大招。

她创办的World Labs,9月1日发布了一个叫Atlas的模型,官方冠名“全球首个多模态世界模型”。

说人话:以前AI是“看图说话”,要么生成一张好看的图,要么生成一段像样的视频,但画面里的东西,它其实并不真懂。

Atlas不一样。它从零开始训练,把文字、图片、视频、相机位置、深度信息全部塞进同一个模型,学出来一个东西——空间感。

一张普通照片喂进去,它能“脑补”出没拍到的地方。给一张机器人的正面照,它把背影给你补全;给一张泳池边角,它顺手把旁边的草坪和远山修好。

它还会运镜。1到6张照片,定好镜头轨迹,就能生成最长1分钟、1440p高清的视频,镜头想怎么走就怎么走,像素级精准,不糊不飘。

最狠的是重建。过去给一个地方做3D模型,要架几百台相机、拍上千张照片。Atlas用2到25张随手拍的照片,就把斯坦福大学的整个主方庭重建了出来,还生成了一条从高空俯冲下去的“飞行路线”。

手机拍的普通视频,它也能玩出《黑客帝国》那种“子弹时间”——时间暂停,镜头绕着人转。

但李飞飞的野心,不在拍电影。

她念叨了好几年一个判断:AI想真正理解世界,光会认字、看图不够,必须有“空间智能”。这是她眼里AI缺失的另一半。

Atlas真正瞄准的,是机器人。

拿手机扫一遍房间,几分钟就能变成一个机器人能走、能摸、能推的虚拟训练场,还能同步生成机器人“眼睛”看到的画面和深度数据。以前机器人练手,得真机一台台试,又贵又慢;现在可以先在仿真世界里练够,再上真机。

这条“真实到仿真、仿真回现实”的路,可能是具身智能落地最快的一条。

当然,质疑也不少。Atlas铺得高调,但没发论文、没公开参数和定价,评测基本是自家说自家好,第三方还没验证过。离一个真正能模拟物理、理解因果的“世界模拟器”,还差得远。

但信号已经足够清晰:

AI卷完文字,卷完图像和视频,下一个战场,是空间。

谁能先让机器“看懂”三维世界,谁就拿到了通往具身智能、通往真实世界的船票。

李飞飞押的,就是这一注。