
AI造的世界,一直是哑巴。
过去两年,视频生成模型卷疯了。4K、物理一致、画面越来越真,时长越来越长。
可你戴上耳机进去,一片死寂。
车从身边驶过,没有轰鸣。门被推开,没有声响。野兽就在不远处低吼,你什么都听不见。
有画无声,不成世界。
这个短板,终于有人补上了。
8月17日,一家叫Noiz AI的团队,联合港科大、清华、CMU、Google DeepMind的研究员,发布了HelixWorld 1.0——一个实时可交互的音视频世界模型。
丢进去一张图、一句提示词,一个世界就展开了。
你往前走,画面和声音同时跟上。你转身,声场跟着转。你走到哪,世界就延伸到哪。
关键不是多了一条音轨。
声音在交互世界里,远不止背景音乐。离多远、踩在什么材质上、声音从哪个方向来,全都不一样。身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。
更狠的是,画面和声音是同一个Transformer一起生成的,从一开始就绑在一起。不是视频做完再配个音,而是声画同源。
24帧画面,48kHz双声道,实时生成。
接下来几周,HelixWorld的权重和代码将完全开源。
为什么值得关注?
因为世界模型,正在从”旁观”走向”参与”。
以前的多模态模型,都是围着Prompt转:输入一句话,生成一次,任务结束。
但真实世界不会因为Prompt结束就停住。环境还在变,人还在动,新事件还在发生。
世界模型得一直跑着,不能用完就关机。
再往后,世界里不会只有一个人。多智能体、多人现场、超长时间一致性、世界自主进化——这些才是真正的下一站。
到那时,游戏、互动影视、教育,全都会被改写。
你开口,世界会回应。你转身离开,里面的故事还在继续。
这才是AI该有的样子。
留言 0
还没有留言,快来抢沙发