FLUX3 AI视频生成

以前用AI做视频,最尴尬的是什么?

画面能看,声音全哑。

对白、音效、环境声,都得后期一个一个贴上去。做个10秒的片子,配音比生成还费劲。

Black Forest Labs刚发布的FLUX3,把这个环节直接砍了。

画面和声音,同一个模型一起算出来。说话带口型,刮风带风声,弹吉他连箱体的共鸣都对。不是从素材库找的,是模型自己“听”出来的。

FLUX3 视频模型

一个模型,能干六件事:生图、生视频、配音、续写、多机位、甚至预测机器人的动作。

多模态喊了好几年,这次是真把图、视频、音频揉进了同一个架构,而不是拿三个模型硬拼。

有个圈内说法挺扎心:Sora是拍给人看的电影,FLUX3是拍给机器人学的教材。

这话不夸张。FLUX3生成的视频,能直接当训练数据喂给机器人。猫跳桌子的画面,机器人不光“看”到,还能推算出跳跃的力学轨迹。奥迪的生产线上,已经在用它装车门密封条了。

AI视频的老毛病,它也在治。

人脸不扭曲、手不畸形、动作不僵硬、画面里的文字不糊。这些AI视频被吐槽最多的点,FLUX3用“Self-Flow”的训法从底层解决了。

FLUX3 多模态对比

更实用的,是视频续写。

以前延长视频,只能拿最后一帧当静态图重新生成,镜头一顿一顿的。FLUX3能吃进4秒的完整音视频上下文,镜头、对话无缝往下接。20秒的上限,就这么被捅开了。

最狠的是价格。

草稿模式0.06美元/秒,先低成本试方向,满意了再一键出高清。做片子的试错成本,直接砍掉一半多。

别忘了它是谁做的。

Stable Diffusion创始团队。从StabilityAI出走的那帮德国人,靠开源基因一路做到今天。FLUX3的开源权重版本,今年晚些时候也会放出来。

届时,独立实验室和开源社区,会把视频生成这场仗打到什么程度,谁也说不准。

唯一能确定的是:

AI做视频的“默片时代”,结束了。

信息来源:Black Forest Labs官方、AIbase、IT之家等公开报道