Flux 3 × Mimic: 下一代影片動作模型
FLUX 3 是 Black Forest Labs 開發的新一代多模態基礎模型,能夠聯合生成影像、影片和音訊,並具備世界理解能力。與 mimic robotics 合作打造的 FLUX-mimic 是一個基於 FLUX 3 的影片動作模型,已成功部署在奧迪的生產線上,展示了從內容生成到物理 AI 的自然延伸。
黑森林實驗室(Black Forest Labs)近日釋出了其最新多模態基礎模型 FLUX 3,並展示了與 mimic robotics 合作開發的影片動作模型 FLUX-mimic。該模型已在奧迪的工廠生產線上進行測試和部署,標誌著從內容生成到物理AI的自然跨越。
FLUX 3 是 FLUX 系列的最新成員。與專注於影像生成的 FLUX 1 和 FLUX 2 不同,FLUX 3 從一開始就聯合訓練了影像、影片和音訊三種模態。其中,影片預測是最具挑戰性的部分,佔據了超過95%的總計算成本。為了生成逼真的影片,模型必須學習接觸、運動、重量、因果關係等物理概念;任何一個環節出錯都會導致視覺上的不真實。因此,FLUX 3 實際上是一個世界模型,而內容生成只是其能力之一。
FLUX-mimic 的誕生源於一個關鍵洞察:動作預測與影片、音訊共享相同的底層物理現實。動作是機器人狀態的低維表示,與視覺觀察緊密耦合。如果模型已經學習了影片和音訊背後的物理過程,那麼動作預測並不是全新的任務,而是對已建模現實的另一種檢視。黑森林實驗室和 mimic 的合作驗證了這一點。他們將 FLUX 3 作為骨幹網路,在其中間特徵之上訓練了一個輕量級動作解碼器,從而實現了 FLUX-mimic。
實驗表明,在大型訓練中,當加入動作預測任務時,影片生成質量最初會下降最多10%,但經過約3500步後,模型完全恢復了之前的生成質量,同時具備了動作預測能力。這說明,整合新的模態並不會永久消耗模型的容量,只需學習該模態與現有世界模型的關係即可。這種統一骨幹網路的方法使得物理AI成為黑森林實驗室路線圖的自然延伸,而非方向改變。
FLUX-mimic 在真實工廠場景中展示了強大的效能。部署任務包括將零件分揀到結構化的托盤、將電子控制單元插入緊密配合的夾具、組裝元件以及處理密封件和線纜等柔軟材料——這些是傳統自動化從未能觸及的領域。基準測試表明,即使在完全凍結 FLUX 骨幹網路的情況下,動作解碼器的表現也優於先前的視覺-語言-動作模型;而微調骨幹網路後,FLUX-mimic 達到了最先進的成功率。
更值得關注的是,由於世界知識已經內化在骨幹網路的表示中,學習新任務所需的示範資料顯著減少。Self-Flow 方法使得動作預測在達到相同成功率時所需的訓練步驟減半,而 FLUX-mimic 結合了更高樣本效率的優勢。模型還展現出自然的失敗恢復能力:即使抓取失敗,機器人也會自動糾正並完成任務,這種能力從未在示範資料中顯式訓練過。
在即時性方面,FLUX-mimic 的骨幹網路在單塊 NVIDIA RTX 5090 GPU 上執行時間低於80毫秒,與人類視覺反應時間相當。透過進一步最佳化整個部署堆疊,包括動作解碼器、感測器-模型-執行器間的程序延遲以及即時分塊預測與執行重疊,最終機器人系統的反應時間達到了101毫秒。
FLUX 3 及其衍生的 FLUX-mimic 代表了基礎模型在機器人領域應用的重要進展。黑森林實驗室表示,他們的重點始終是構建理解世界的模型,而行動只是這種理解的自然產物。隨著 FLUX 3 的持續發展,未來有望在更多領域看到其影響力。