AI生成3D世界

李飞飞又搞了个大的。

她创办的World Labs,前几天发布了新一代模型,叫Atlas。

名字硬,做的事更硬:给它几张普通照片,它能当场“脑补”出一个完整的3D世界。

先看它能干嘛。

给1到6张照片,再告诉它镜头怎么走,它能输出最长1分钟、清晰度到1440p的视频。

镜头角度不用打字描述,直接把坐标传给模型——指哪打哪。

斯坦福大学有个广场,有人用2到25张游客随手拍的照片喂给它,结果草坪、拱廊、教堂外墙全被还原了,还顺手生成了航拍视角。

一张只拍到机器人正面的照片,它能补全背面。一张泳池边角照,它能脑补出没拍到的草坪和远山。

官方称它是“全球首个多模态世界模型”。说人话就是:以前AI在2D平面上画画,现在它开始学着在3D空间里“搭场景”。

更值钱的用法,在机器人那边。

以前训练机器人,得扛着专业设备围着场地转几十圈,又贵又慢。

现在呢?手机随手拍一段,AI就能搭出仿真环境,机器人直接在里面练,练完再上真身。

这套“真实转模拟”的打法,可能把机器人训练的门槛和成本,狠狠砸下来一截。

为什么是李飞飞来干这件事?

她是“AI教母”,当年靠ImageNet喂大了整个计算机视觉。

这两年她一直念叨一句话:大模型教会了AI“说话”,但AI要真正理解世界,得先懂“空间”。

她管这个叫空间智能,说它是AGI必要的一半。

Atlas,就是她把这套想法第一次从论文搬进现实的产物。

然后说点泼冷水的。

别被“理解3D世界”这种标题带跑了。

Atlas擅长的,是几何上连贯的静态场景。它会在没拍到的地方“脑补”,参考图越少,幻觉越多。

它现在更像一个“会搭空间的模型”,离“懂物理定律的模型”还差得远。

而且眼下只对少数合作伙伴开放,独立评测也没经过大规模拷打。

但方向已经很清楚了。

AI竞争的下半场,可能要从“谁更会说话”,变成“谁更会造世界”。

上一次我们以为AI的尽头是聊天,结果它学会了画画。

这次,它开始造三维空间了。

下一步呢?谁知道。