AI 卷完“会说话”,该卷“懂空间”了

前段时间,全网 AI 都在卷“会说话”——写代码、写稿子、画图、剪视频。
“AI 教母”李飞飞,这次押了条不一样的路:让 AI “懂空间”。
9 月 1 日,她创办的 World Labs 发布“全球首个多模态世界模型”:Atlas。
一句话说清它干的事:以前 AI 是“看一张图、出一张图”;现在,它“看几张图,还原出一个 3D 世界”,你还能改变相机角度,进去“逛逛”。
官方演示里有个例子很直观:只给一张机器人的正面照,Atlas 能自己补出没拍到的背面。给一张泳池边角的照片,它能“脑补”出隔壁没拍到的草坪和远山。
更狠的是空间重建。斯坦福主方庭,过去要还原它,得扛着专业设备围着转几十圈,拍好几百上千张照片。Atlas 只用了 2 到 25 张游客随手拍的地面照,就还原出草坪、拱廊、纪念教堂的全部细节,还能生成上帝视角的航拍漫游。
凭什么做到?秘密在“空间上下文”。
大模型处理文字,是把文字编码成“上下文”再生成;Atlas 思路一样,区别在于:它给每一张输入图片都锚定一个三维坐标,相机位置、深度信息一起进来。
打个比方:大模型手里是本“文字地图”,Atlas 手里是一本带坐标轴和比例尺的“三维草稿本”。所以它的镜头控制是“像素级精确”的——给 1 到 6 张照片,设定一条相机轨迹,就能生成最长 1 分钟、1440p 的视频。镜头往哪走,是几何算出来的,不用再靠运气“抽卡”。
那这玩意儿除了做特效、做游戏,到底有啥用?答案藏在一个更焦虑的行业:机器人。

圈内人常说,具身智能最大的瓶颈不是算法,是数据。机器人要学走路、学抓取,需要海量真实交互数据。可真人现场采数据,又贵又慢,还有风险。这行不叫数据“稀缺”,叫“数据荒”。
Atlas 的解法叫 Real-to-Sim:拿手机拍一段房间视频,各取几十帧,它就能重建出这间屋子的 3D 仿真环境。然后让不同形态的机器人在虚拟空间里随便跑,模型实时生成机器人“眼睛”该看到的画面和高精度深度数据。
过去要把一间工厂、一套住宅变成仿真训练场,得靠专业扫描建模设备;现在被压缩成一句话:拿手机拍段视频。
世界模型,正在变成具身智能的“新基建”——在虚拟世界里批量造经验,再喂给现实中的机器人。
当然,也得泼盆冷水。
Atlas 现在还处于早期访问阶段,论文、模型卡、定价都还没公布。它擅长几何连贯的静态空间,不是能模拟物理定律的引擎;照片没拍到的地方靠“脑补”,参考图越少,幻觉越多。评测也大多来自官方自己的说法,还没经过第三方大规模“拷打”。
但大方向已经很清楚了:这一代 AI 争的是“谁会说话”,下一程,恐怕要争“谁更懂这个三维世界”。
李飞飞一直说:空间智能,是 AGI 缺失的另一半。从“生成好看的画面”,到“生成够用的世界”——AI 正在从“看懂世界”,走向“走进世界”。