MiniMax H3

7月31日,MiniMax发布全模态生成模型H3。这东西能同时理解文本、图像、视频、声音,然后输出带原生双声道、最高15秒的2K视频。

翻译成人话:你用一句话加一张图加一段音频,它能给你剪出一条带音效的视频。不是PPT转场那种,是正经的后期级输出。

关键是价格。2K分辨率下每秒不到主流模型的1/3,768P下不到一半。而且MiniMax说了,过几天直接开源模型权重。

这事为什么值得说?

过去两年,视频生成这块基本被闭源模型垄断。Sora、Runway、Pika轮番登场,小公司根本摸不到门槛。现在MiniMax放出H3,一手低价一手开源,直接把牌桌掀了。

H3的几个能力很有意思。它能精准渲染文字——歌词做MV不会糊成马赛克;能做视频到视频的动作迁移——拍一段人物动作直接套到动画角色上;还支持多素材混合——希区柯克式运镜加你上传的图片加指定的背景音乐,它全吃进去,吐出一条完整的片子。

游戏UI、电商广告、电影片头,这些场景以前养着一个后期团队,现在可能一个人加H3就能搞定。

开源这一步更狠。国产芯片已经预适配好了,打的就是"你不卖我卡,我用自家芯片也能跑"的牌。

一句话总结:视频生成不再是巨头游戏。MiniMax用H3证明,开源+低价能打穿闭源的高墙。

这东西真的会改变很多人的工作方式。