FLUX 3 × Mimic:次世代のビデオアクションモデル
FLUX 3 は、Black Forest Labs が開発した新しいマルチモーダル基盤モデルで、画像、動画、音声を統合的に生成し、世界理解能力を持ちます。mimic robotics との協力により、FLUX 3 をベースにしたビデオアクションモデル FLUX-mimic を開発し、アウディの実際の生産ラインに展開され、コンテンツ生成から物理 AI への自然な拡張を示しています。
Black Forest Labs は最新のマルチモーダル基盤モデル FLUX 3 を発表し、mimic robotics との協力により開発されたビデオアクションモデル FLUX-mimic を公開しました。このモデルはアウディの工場生産ラインでテスト・展開され、コンテンツ生成から物理AIへの自然な拡張を示しています。
FLUX 3 は、画像生成を専門としていた FLUX 1 および FLUX 2 とは異なり、画像、動画、音声をゼロから統合学習します。その中でも動画予測は最も困難で、総計算コストの95%以上を占めます。リアルな動画を生成するには、接触、運動、重量、因果関係などの物理概念を学習する必要があり、一つでも間違えると不自然に見えます。したがって、FLUX 3 は本質的に世界モデルであり、コンテンツ生成はその能力の一つに過ぎません。
FLUX-mimic の開発は重要な洞察に基づいています。アクション予測は動画や音声と同じ物理的現実を共有しています。アクションはロボットの状態の低次元表現であり、視覚観察と密接に結びついています。モデルが動画や音声の背後にある物理的プロセスを学習していれば、アクション予測は新たなタスクではなく、既にモデル化された現実の別のビューに過ぎません。Black Forest Labs と mimic はこの仮説を検証し、FLUX 3 のバックボーンの途中の特徴量の上に軽量なアクションデコーダを訓練することで FLUX-mimic を構築しました。
大規模な訓練実験では、アクション予測を追加した際に動画生成品質が最大10%低下しましたが、約3500ステップ後には完全に回復し、アクション予測も可能になりました。これは、新しいモダリティの統合がモデルの容量を永久に消費するわけではなく、単にそのモダリティと既存の世界モデルの関係を学習する必要があることを示しています。この統一バックボーンアプローチにより、物理AIは Black Forest Labs のロードマップの自然な延長となり、方向転換ではありません。
FLUX-mimic は実際の工場環境で優れた性能を発揮しました。タスクには、部品の仕分け、電子制御ユニットの挿入、コンポーネントの組み立て、そして従来の自動化では扱えなかったシールやケーブルなどの柔軟な素材の操作が含まれます。ベンチマークでは、FLUX バックボーンを完全に凍結した状態でも、アクションデコーダは従来の視覚言語行動モデルを上回る性能を示し、バックボーンを微調整した場合には最先端の成功率を達成しました。
さらに、世界知識がバックボーンの表現に内在化されているため、新しいタスクを学習するために必要なデモデータが大幅に削減されます。Self-Flow 手法により、アクション予測は同じ成功率に達するのに必要な訓練ステップが半減し、FLUX-mimic はさらに高いサンプル効率を達成しています。モデルは自然な失敗回復能力も示し、把持に失敗した場合でもロボットが自動的に修正してタスクを完了します。これはデモデータで明示的に訓練されたものではありません。
リアルタイム性に関して、FLUX-mimic のバックボーンは単一の NVIDIA RTX 5090 GPU で80ms未満で動作し、人間の視覚反応時間と同等です。アクションデコーダ、センサー・モデル・アクチュエータ間のプロセス遅延の削減、予測と実行を重ねるリアルタイムチャンキングなどの最適化により、ロボットシステム全体の反応時間は101msに達しました。
FLUX 3 と FLUX-mimic は、基盤モデルのロボット応用における重要な進歩を示しています。Black Forest Labs は、世界を理解するモデルを構築することに注力しており、行動はその理解の自然な産物であると述べています。FLUX 3 の今後の発展により、さらなる分野での影響が期待されます。