AI圈又炸了。
这次的主角,是李飞飞。
她创办的公司World Labs,在9月1日扔出一个重磅:Atlas——一个被称作「全球首个多模态世界模型」的东西。

名字听着玄乎,说白了就三件事:
第一,给几张照片,它能生成最长1分钟、1440P画质的视频,镜头怎么走完全由你控制——不用再靠文字提示词碰运气。
第二,它能从几张普通照片里,把整个3D空间重建出来。斯坦福的主草坪,只用了2到25张游客随手拍,就还原出完整场景,还能给你来一段无人机俯拍。
第三,它是从零开始训练的。文字、图片、视频、3D,第一次被塞进同一个模型里,谁也不是谁的插件。
为什么这件事值得说道?
因为以前的文生视频,基本都在「猜」。
你在提示框里写一句「镜头缓慢左移」,生成出来什么样,全看模型当天心情。
而Atlas把相机位置、深度信息当成「原生输入」来处理。相当于直接告诉它:世界是有坐标的,不是一张白纸。
换句话说,大模型拼的是「读懂文字」,Atlas拼的是「理解空间」。
李飞飞这些年一直念叨一句话:AI要是没有「空间智能」,就别谈什么AGI。
当年图像识别靠她,今天世界模型还是她。
当然,故事讲到这,真正想勾住的是大客户。
World Labs的终极目标,其实是机器人。
你用手机拍一间屋子,它能给你造出一个3D仿真环境,让机器人先在虚拟世界里学会走路、抓东西,再上真机。
这公司成立不到两年,融资已经超过12亿美元,英伟达、AMD、Autodesk全都下场押注。
从「生成好看的画面」,到「生成够用的世界」。
AI的下一个拐点,可能真的已经来了。
留言 0
还没有留言,快来抢沙发