AI News HubLIVE
站內改寫2 分鐘閱讀

Flux 3 × Mimic: 下一代視頻動作模型

FLUX 3 是 Black Forest Labs 開發的新一代多模態基礎模型,能夠聯合生成圖像、視頻和音頻,並具備世界理解能力。與 mimic robotics 合作打造的 FLUX-mimic 是一個基於 FLUX 3 的視頻動作模型,已成功部署在奧迪的生產線上,展示了從內容生成到物理 AI 的自然延伸。

來源Hacker News AI作者: kensai

黑森林實驗室(Black Forest Labs)近日發佈了其最新多模態基礎模型 FLUX 3,並展示了與 mimic robotics 合作開發的視頻動作模型 FLUX-mimic。該模型已在奧迪的工廠生產線上進行測試和部署,標誌着從內容生成到物理AI的自然跨越。

FLUX 3 是 FLUX 系列的最新成員。與專注於圖像生成的 FLUX 1 和 FLUX 2 不同,FLUX 3 從一開始就聯合訓練了圖像、視頻和音頻三種模態。其中,視頻預測是最具挑戰性的部分,佔據了超過95%的總計算成本。為了生成逼真的視頻,模型必須學習接觸、運動、重量、因果關係等物理概念;任何一個環節出錯都會導致視覺上的不真實。因此,FLUX 3 實際上是一個世界模型,而內容生成只是其能力之一。

FLUX-mimic 的誕生源於一個關鍵洞察:動作預測與視頻、音頻共享相同的底層物理現實。動作是機器人狀態的低維表示,與視覺觀察緊密耦合。如果模型已經學習了視頻和音頻背後的物理過程,那麼動作預測並不是全新的任務,而是對已建模現實的另一種視圖。黑森林實驗室和 mimic 的合作驗證了這一點。他們將 FLUX 3 作為骨幹網絡,在其中間特徵之上訓練了一個輕量級動作解碼器,從而實現了 FLUX-mimic。

實驗表明,在大型訓練中,當加入動作預測任務時,視頻生成質量最初會下降最多10%,但經過約3500步後,模型完全恢復了之前的生成質量,同時具備了動作預測能力。這説明,集成新的模態並不會永久消耗模型的容量,只需學習該模態與現有世界模型的關係即可。這種統一骨幹網絡的方法使得物理AI成為黑森林實驗室路線圖的自然延伸,而非方向改變。

FLUX-mimic 在真實工廠場景中展示了強大的性能。部署任務包括將零件分揀到結構化的托盤、將電子控制單元插入緊密配合的夾具、組裝組件以及處理密封件和線纜等柔軟材料——這些是傳統自動化從未能觸及的領域。基準測試表明,即使在完全凍結 FLUX 骨幹網絡的情況下,動作解碼器的表現也優於先前的視覺-語言-動作模型;而微調骨幹網絡後,FLUX-mimic 達到了最先進的成功率。

更值得關注的是,由於世界知識已經內化在骨幹網絡的表示中,學習新任務所需的示範數據顯著減少。Self-Flow 方法使得動作預測在達到相同成功率時所需的訓練步驟減半,而 FLUX-mimic 結合了更高樣本效率的優勢。模型還展現出自然的失敗恢復能力:即使抓取失敗,機器人也會自動糾正並完成任務,這種能力從未在示範數據中顯式訓練過。

在實時性方面,FLUX-mimic 的骨幹網絡在單塊 NVIDIA RTX 5090 GPU 上運行時間低於80毫秒,與人類視覺反應時間相當。通過進一步優化整個部署堆棧,包括動作解碼器、傳感器-模型-執行器間的進程延遲以及實時分塊預測與執行重疊,最終機器人系統的反應時間達到了101毫秒。

FLUX 3 及其衍生的 FLUX-mimic 代表了基礎模型在機器人領域應用的重要進展。黑森林實驗室表示,他們的重點始終是構建理解世界的模型,而行動只是這種理解的自然產物。隨着 FLUX 3 的持續發展,未來有望在更多領域看到其影響力。