
李飞飞又搞了个大的。
她创办的World Labs,前几天发布了新一代模型,叫Atlas。
名字硬,做的事更硬:给它几张普通照片,它能当场“脑补”出一个完整的3D世界。
先看它能干嘛。
给1到6张照片,再告诉它镜头怎么走,它能输出最长1分钟、清晰度到1440p的视频。
镜头角度不用打字描述,直接把坐标传给模型——指哪打哪。
斯坦福大学有个广场,有人用2到25张游客随手拍的照片喂给它,结果草坪、拱廊、教堂外墙全被还原了,还顺手生成了航拍视角。
一张只拍到机器人正面的照片,它能补全背面。一张泳池边角照,它能脑补出没拍到的草坪和远山。
官方称它是“全球首个多模态世界模型”。说人话就是:以前AI在2D平面上画画,现在它开始学着在3D空间里“搭场景”。
更值钱的用法,在机器人那边。
以前训练机器人,得扛着专业设备围着场地转几十圈,又贵又慢。
现在呢?手机随手拍一段,AI就能搭出仿真环境,机器人直接在里面练,练完再上真身。
这套“真实转模拟”的打法,可能把机器人训练的门槛和成本,狠狠砸下来一截。
为什么是李飞飞来干这件事?
她是“AI教母”,当年靠ImageNet喂大了整个计算机视觉。
这两年她一直念叨一句话:大模型教会了AI“说话”,但AI要真正理解世界,得先懂“空间”。
她管这个叫空间智能,说它是AGI必要的一半。
Atlas,就是她把这套想法第一次从论文搬进现实的产物。
然后说点泼冷水的。
别被“理解3D世界”这种标题带跑了。
Atlas擅长的,是几何上连贯的静态场景。它会在没拍到的地方“脑补”,参考图越少,幻觉越多。
它现在更像一个“会搭空间的模型”,离“懂物理定律的模型”还差得远。
而且眼下只对少数合作伙伴开放,独立评测也没经过大规模拷打。
但方向已经很清楚了。
AI竞争的下半场,可能要从“谁更会说话”,变成“谁更会造世界”。
上一次我们以为AI的尽头是聊天,结果它学会了画画。
这次,它开始造三维空间了。
下一步呢?谁知道。
留言 0
还没有留言,快来抢沙发