AI世界模型

AI造的世界,一直是哑巴。

过去两年,视频生成模型卷疯了。4K、物理一致、画面越来越真,时长越来越长。

可你戴上耳机进去,一片死寂。

车从身边驶过,没有轰鸣。门被推开,没有声响。野兽就在不远处低吼,你什么都听不见。

有画无声,不成世界。

这个短板,终于有人补上了。

8月17日,一家叫Noiz AI的团队,联合港科大、清华、CMU、Google DeepMind的研究员,发布了HelixWorld 1.0——一个实时可交互的音视频世界模型。

丢进去一张图、一句提示词,一个世界就展开了。

你往前走,画面和声音同时跟上。你转身,声场跟着转。你走到哪,世界就延伸到哪。

关键不是多了一条音轨。

声音在交互世界里,远不止背景音乐。离多远、踩在什么材质上、声音从哪个方向来,全都不一样。身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。

更狠的是,画面和声音是同一个Transformer一起生成的,从一开始就绑在一起。不是视频做完再配个音,而是声画同源。

24帧画面,48kHz双声道,实时生成。

接下来几周,HelixWorld的权重和代码将完全开源。

为什么值得关注?

因为世界模型,正在从”旁观”走向”参与”。

以前的多模态模型,都是围着Prompt转:输入一句话,生成一次,任务结束。

但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件还在发生。

世界模型得一直跑着,不能用完就关机。

再往后,世界里不会只有一个人。多智能体、多人现场、超长时间一致性、世界自主进化——这些才是真正的下一站。

到那时,游戏、互动影视、教育,全都会被改写。

你开口,世界会回应。你转身离开,里面的故事还在继续。

这才是AI该有的样子。