黑森林实验室发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型
黑森林实验室(BFL)发布了FLUX 3,这是一个多模态基础模型,能够在单一架构中学习图像、视频和音频。它是首个从同一权重集输出视频、音频和动作预测的FLUX模型。FLUX 3基于Self-Flow方法,该方法结合了流匹配目标和自监督特征重建目标。该模型在视频生成方面表现出色,能够生成长达20秒的片段并自带音频。在人类偏好测试中,FLUX 3在多个对比中胜出。此外,同一骨干网络还驱动了FLUX-mimic机器人策略,响应时间低于80毫秒。
黑森林实验室(BFL)近日发布了FLUX 3,这是一款多模态基础模型,能够在单一架构中同时学习图像、视频和音频。FLUX 3也是首个从同一套权重中输出视频、音频和动作预测的FLUX模型。
BFL研究团队认为,没有任何单一模态能够完整描述世界。图像捕捉某一时刻的空间结构,视频恢复时间维度并揭示物理动态,音频则揭示机械事件与声音之间的因果关系。每种模态都被视为对同一底层现实的有损投影。当同时对所有模态进行训练时,它们之间相互约束:声音必须与冲击匹配,运动必须遵循质量规律。研究团队称,FLUX 3是其首个完全基于这一原则构建的模型。
底层方法:Self-Flow
FLUX 3建立在Self-Flow方法之上,这是BFL提出的一种在统一架构中对齐多模态生成与理解的方法。Self-Flow结合了流匹配目标与自监督特征重建目标。其在GitHub上的参考实现采用Apache-2.0许可,使用SiT-XL/2模型,并采用每token时间步条件化。训练时使用25%的每token掩码率,并通过EMA教师模型在层20到学生模型层8进行自蒸馏。
需要注意的是,该发布版本是一个ImageNet 256×256研究模型,并非FLUX 3本身。BFL表示,他们基于相同方法“显著扩展了计算和数据资源”,以训练跨视频、图像和音频的FLUX 3。Self-Flow本身于2026年3月推出,并非本次发布的新内容。真正的新颖之处在于其规模。
FLUX 3 Video的功能
FLUX 3 Video能够一次性生成长达20秒的视频片段,并自带原生音频。支持的模式包括文本到视频、图像到视频、参考片段到视频、关键帧到视频(用于控制转场),以及基于输入视频和音频的生成式视频-音频续写。
BFL还列出了多语言对话、将片段链接成多镜头序列的代理链、以及带有动画设计的强大文字排版生成。BFL团队特别指出,该模型在人类面部表情以及将声音与物理事件关联方面表现出色。
性能
BFL团队发布了初步的人类偏好结果。测试设置是10秒文本到视频片段,720p分辨率并带音频。FLUX 3在93%的对比中优于Luma Ray 3.2,在77%的对比中优于Runway Gen-4.5。与Grok Imagine Video相比,比例为69%,与Kling v3 Pro相比为60%,与Happy Horse v1相比为59%,与Happy Horse 1.1相比为57%。与Seedance 2.0和Gemini Omni Flash相比,结果为52%,接近随机水平。
关键要点
FLUX 3是一个单一的流匹配主干网络,联合训练于图像、视频和音频。FLUX 3 Video能够一次性生成最长20秒的视频并自带原生音频。视频预测消耗了超过95%的训练计算资源,而音频仅占不到0.5%的token。同一骨干网络还驱动了FLUX-mimic机器人策略,在单张RTX 5090上运行时间低于80毫秒。访问权限逐步开放:视频和动作功能目前处于早期访问阶段,图像功能随后,最后才会开放权重。
欲了解更多信息,请查阅FLUX 3公告、FLUX 3 x mimic技术文章以及Self-Flow论文。本研究的全部功劳归于该项目的研究人员。