AI圈又炸了。

这次的主角,是李飞飞。

她创办的公司World Labs,在9月1日扔出一个重磅:Atlas——一个被称作「全球首个多模态世界模型」的东西。

李飞飞 World Labs Atlas 世界模型

名字听着玄乎,说白了就三件事:

第一,给几张照片,它能生成最长1分钟、1440P画质的视频,镜头怎么走完全由你控制——不用再靠文字提示词碰运气。

第二,它能从几张普通照片里,把整个3D空间重建出来。斯坦福的主草坪,只用了2到25张游客随手拍,就还原出完整场景,还能给你来一段无人机俯拍。

第三,它是从零开始训练的。文字、图片、视频、3D,第一次被塞进同一个模型里,谁也不是谁的插件。

为什么这件事值得说道?
因为以前的文生视频,基本都在「猜」。

你在提示框里写一句「镜头缓慢左移」,生成出来什么样,全看模型当天心情。

而Atlas把相机位置、深度信息当成「原生输入」来处理。相当于直接告诉它:世界是有坐标的,不是一张白纸。

换句话说,大模型拼的是「读懂文字」,Atlas拼的是「理解空间」。

李飞飞这些年一直念叨一句话:AI要是没有「空间智能」,就别谈什么AGI。

当年图像识别靠她,今天世界模型还是她。

当然,故事讲到这,真正想勾住的是大客户。

World Labs的终极目标,其实是机器人。

你用手机拍一间屋子,它能给你造出一个3D仿真环境,让机器人先在虚拟世界里学会走路、抓东西,再上真机。

这公司成立不到两年,融资已经超过12亿美元,英伟达、AMD、Autodesk全都下场押注。

从「生成好看的画面」,到「生成够用的世界」。

AI的下一个拐点,可能真的已经来了。