AI News HubLIVE
站内改写2 分钟阅读

FLUX 3:迈向多模态流模型作为视觉智能的骨干

FLUX 3是Black Forest Labs发布的新一代多模态基础模型,统一处理图像、视频和音频,旨在学习世界的统一表示。模型支持文本到视频、图像到视频、视频到视频等多种生成任务,并在视频生成中实现了高达20秒的时长和原生音频。初步评估显示,FLUX 3在多项对比中优于其他模型,尤其在面部表情、声音与事件关联和多语言能力方面表现出色。模型还具备图像生成和动作预测能力,计划逐步开放API、私有权重和开源权重。

来源Hacker News AI作者: ThouYS

Black Forest Labs 正式发布了其最新的多模态基础模型 FLUX 3,该模型旨在通过统一架构联合学习图像、视频和音频,从而构建对真实世界的视觉智能。FLUX 3 基于 Self-Flow 方法,该方法高效地统一了多模态生成与理解,并在训练中大幅扩展了计算和数据资源。

FLUX 3 的核心原则是:没有任何单一模态能提供完整的描述,每种模态都是同一真实世界的投影,但会丢失部分信息。图像捕捉空间结构和关系,视频恢复时间维度并揭示动态和物理规律,音频揭示视觉无法检测的机械与声学因果关系,语言则将感知与目标和抽象概念联系起来。通过同时学习所有模态,它们之间的相互约束能提供更丰富的信息。

在视频生成方面,FLUX 3 可生成最长 20 秒的多样化视频,并自带音频。其核心能力包括文本到视频、图像到视频(用作起始帧或视觉参考)、视频到视频(将源视频的核心元素带入新场景)、生成式视频-音频延续、关键帧到视频、多语言对话、多种视觉风格和宽高比、以及通过智能体方式将多个片段串联成长序列。初步评估显示,在 720p 的 10 秒文本到视频片段对比中,FLUX 3 在 69% 的对比中优于 Grok Imagine Video,60% 优于 Kling v3 Pro,59% 优于 Happy Horse v1,57% 优于 Happy Horse 1.1,52% 优于 Seedance 2.0 和 Gemini Omni Flash,77% 优于 Runway Gen-4.5,93% 优于 Luma Ray 3.2。FLUX 3 在捕捉人类面部表情、声音与物理事件关联以及多语言能力方面尤为突出。FLUX 3 Video 现已进入早期访问阶段。

在图像生成方面,FLUX 3 能够合成和编辑多种风格、宽高比和分辨率的图像。初步评估显示,相比早期版本的 FLUX,其对复杂提示词和文本生成的处理能力显著提升,并能渲染多种语言的高精度文本。FLUX 3 Image 的早期访问将在未来几周内开放。

在动作预测方面,FLUX 3 的世界理解能力扩展到了动作预测。团队通过两种途径实现:将原生动作预测直接集成到 FLUX 3 中,以及将预训练的视频骨干作为动态感知基础,供专用动作模型微调。其中,mimic robotics 作为首批合作伙伴,利用 FLUX 3 骨干开发了 FLUX-mimic 视频-动作模型,用于灵巧操作和生产部署。

未来,Black Forest Labs 计划逐步推出以下能力:通过 API 和私有权重提供视频和音频生成与编辑(FLUX 3 Video);通过选定的研究和商业合作伙伴提供动作预测(FLUX-mimic 和 FLUX 3 Action);通过 API 和私有权重提供图像合成与编辑(FLUX 3 Image);以及提供多模态骨干的开源权重(FLUX 3 Dev)。团队还将发布更多技术细节。FLUX 3 的早期访问现已开放申请。