AI News HubLIVE
站内改写2 分钟阅读

Flux 3 × Mimic: 下一代视频动作模型

FLUX 3 是 Black Forest Labs 开发的新一代多模态基础模型,能够联合生成图像、视频和音频,并具备世界理解能力。与 mimic robotics 合作打造的 FLUX-mimic 是一个基于 FLUX 3 的视频动作模型,已成功部署在奥迪的生产线上,展示了从内容生成到物理 AI 的自然延伸。

来源Hacker News AI作者: kensai

黑森林实验室(Black Forest Labs)近日发布了其最新多模态基础模型 FLUX 3,并展示了与 mimic robotics 合作开发的视频动作模型 FLUX-mimic。该模型已在奥迪的工厂生产线上进行测试和部署,标志着从内容生成到物理AI的自然跨越。

FLUX 3 是 FLUX 系列的最新成员。与专注于图像生成的 FLUX 1 和 FLUX 2 不同,FLUX 3 从一开始就联合训练了图像、视频和音频三种模态。其中,视频预测是最具挑战性的部分,占据了超过95%的总计算成本。为了生成逼真的视频,模型必须学习接触、运动、重量、因果关系等物理概念;任何一个环节出错都会导致视觉上的不真实。因此,FLUX 3 实际上是一个世界模型,而内容生成只是其能力之一。

FLUX-mimic 的诞生源于一个关键洞察:动作预测与视频、音频共享相同的底层物理现实。动作是机器人状态的低维表示,与视觉观察紧密耦合。如果模型已经学习了视频和音频背后的物理过程,那么动作预测并不是全新的任务,而是对已建模现实的另一种视图。黑森林实验室和 mimic 的合作验证了这一点。他们将 FLUX 3 作为骨干网络,在其中间特征之上训练了一个轻量级动作解码器,从而实现了 FLUX-mimic。

实验表明,在大型训练中,当加入动作预测任务时,视频生成质量最初会下降最多10%,但经过约3500步后,模型完全恢复了之前的生成质量,同时具备了动作预测能力。这说明,集成新的模态并不会永久消耗模型的容量,只需学习该模态与现有世界模型的关系即可。这种统一骨干网络的方法使得物理AI成为黑森林实验室路线图的自然延伸,而非方向改变。

FLUX-mimic 在真实工厂场景中展示了强大的性能。部署任务包括将零件分拣到结构化的托盘、将电子控制单元插入紧密配合的夹具、组装组件以及处理密封件和线缆等柔软材料——这些是传统自动化从未能触及的领域。基准测试表明,即使在完全冻结 FLUX 骨干网络的情况下,动作解码器的表现也优于先前的视觉-语言-动作模型;而微调骨干网络后,FLUX-mimic 达到了最先进的成功率。

更值得关注的是,由于世界知识已经内化在骨干网络的表示中,学习新任务所需的示范数据显著减少。Self-Flow 方法使得动作预测在达到相同成功率时所需的训练步骤减半,而 FLUX-mimic 结合了更高样本效率的优势。模型还展现出自然的失败恢复能力:即使抓取失败,机器人也会自动纠正并完成任务,这种能力从未在示范数据中显式训练过。

在实时性方面,FLUX-mimic 的骨干网络在单块 NVIDIA RTX 5090 GPU 上运行时间低于80毫秒,与人类视觉反应时间相当。通过进一步优化整个部署堆栈,包括动作解码器、传感器-模型-执行器间的进程延迟以及实时分块预测与执行重叠,最终机器人系统的反应时间达到了101毫秒。

FLUX 3 及其衍生的 FLUX-mimic 代表了基础模型在机器人领域应用的重要进展。黑森林实验室表示,他们的重点始终是构建理解世界的模型,而行动只是这种理解的自然产物。随着 FLUX 3 的持续发展,未来有望在更多领域看到其影响力。