AI News HubLIVE
站內改寫1 分鐘閱讀

PhysBrain 1.0技術報告:從人類影片中學習物理常識以提升機器人能力

PhysBrain 1.0是一種新方法,將大規模人類自我中心影片轉換為結構化物理常識知識,用於改善機器人的理解和控制。透過提取場景元素、空間動態和深度感知關係,訓練視覺語言模型,然後將其適應到機器人策略中。該方法在多個具身AI基準測試中達到最先進水平,尤其在域外任務中表現出色。

來源arXiv Robotics作者: Shijie Lian, Bin Yu, Xiaopeng Lin, Changti Wu, Hang Yuan, Xiaolin Hu, Zhaolong Shen, Yuzhuo Miao, Haishan Liu, Yuxuan Tian, Yukun Shi, Cong Huang, Kai Chen

近年來,視覺-語言-動作模型取得了顯著進展,但僅依靠機器人軌跡資料來學習廣泛的物理理解能力仍存在覆蓋不足的問題。PhysBrain 1.0技術報告提出了一種補充性思路:在大規模人類自我中心影片中提取結構化的物理常識監督訊號,然後在機器人適應階段進行遷移。該研究由Shijie Lian等13位作者共同完成,相關論文已提交至arXiv(編號2605.15298)。

PhysBrain 1.0的核心是一個資料引擎,它能夠從人類影片中自動提取場景元素、空間動態、動作執行過程以及深度感知關係。這些資訊隨後被轉化為問答形式的監督資料,用於訓練PhysBrain視覺語言模型(VLM)。例如,資料引擎可以識別物體之間的相對位置、運動軌跡以及人與環境的互動模式。經過訓練的模型獲得了物理先驗知識,透過一種既保留原始能力又對語言敏感的適應設計,這些先驗知識被進一步遷移到視覺-語言-動作(VLA)策略中。這種設計確保了模型在適應機器人控制時不會遺忘原有的多模態理解能力,同時能夠根據自然語言指令靈活調整行為。

在多項多模態問答基準和具身控制基準測試中,PhysBrain 1.0均取得了最先進(SOTA)的結果。具體測試包括ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa。特別值得一提的是,在SimplerEnv的域外(out-of-domain)測試中,PhysBrain 1.0表現尤為突出,顯示出強大的泛化能力。這些結果表明,從人類互動影片中擴充套件物理常識知識,能夠有效連線多模態理解與機器人動作執行,為未來機器人學習提供了一條有前景的路徑。此外,研究團隊還計劃進一步探索如何將來自不同環境和任務的影片資料整合,以構建更通用的物理常識表示。