MolmoMotion是由艾倫人工智慧研究所(Ai2)開發的一種突破性3D運動預測模型。與傳統的運動感知模型不同,它能夠預測物體未來的運動軌跡,而非僅僅分析已經發生的運動。該模型透過結合影片幀、物體表面3D點以及自然語言指令,預測未來數秒內物體點的3D位置變化,在多項基準測試中顯著優於現有方法。
運動感知通常是回顧性的:它解釋已經發生的運動。但許多實際應用需要前瞻性預測,例如機器人抓取杯子時必須預判杯子的運動,影片生成器需要知道接下來合理的運動以生成物理上合理的幀。MolmoMotion正是為解決這一挑戰而設計。給定一段RGB影片、物體上的一組查詢點以及動作描述(如“移動並旋轉桌上的水果木碗”),模型輸出這些點在接下來幾秒內的3D軌跡。
MolmoMotion採用了一種高效的運動表示:物體附著在3D世界空間中的點。這種表示具有三個關鍵特性:類別無關(不依賴人體、手部、剛體等預設模板)、視角穩定(同一物理運動在不同攝像頭和視角下保持一致)以及可直接用於下游系統(如機器人策略或影片生成模型)。稀疏的表面點集可以描述剛體、鉸接物體以及有限程度內的變形運動,無需假設物體型別。
模型基於Molmo 2骨幹網路,將語言指令與影像中的物體和點關聯起來。給定短期影片歷史、動作描述和一組帶有初始3D位置的查詢點,模型首先識別所指的物體和查詢點,然後預測每個點的未來3D軌跡。訓練了兩種變體:自迴歸變體(MolmoMotion-AR)逐步預測未來座標,適用於路徑明確的場景;流匹配變體(MolmoMotion-FM)透過將噪聲變換為運動來預測連續3D空間中的軌跡,更適合處理多條可能未來的不確定性。
為了訓練和評估模型,研究團隊構建了MolmoMotion-1M資料集,這是迄今為止最大的帶有動作描述的物體3D點軌跡集合,包含116萬影片,覆蓋736種運動型別和5600種不同物體。他們開發了一個自動流水線,從非約束影片中提取物體相關的3D軌跡,包括過濾噪聲、平滑軌跡和剪輯有意義運動片段。同時釋出了PointMotionBench基準測試,包含2700個影片片段,覆蓋111個物體類別和61種運動型別,用於量化評估3D運動預測的準確性。
實驗結果表明,MolmoMotion在PointMotionBench上超越了所有現有方法,包括畫素空間影片生成器、引數化3D方法和勻速基線。在下游任務中,經過微調的MolmoMotion在機器人操作任務中表現出色:在模擬環境中,基於MolmoMotion的控制策略在拾取放置任務上成功率達76.3%,而基於Molmo 2的策略僅為56.0%,且學習速度更快;在真實機器人上,MolmoMotion僅需約2000步訓練即可達到Molmo 2基線在12000步後的測試L2誤差。在影片生成方面,將MolmoMotion的預測軌跡輸入影像到影片模型,可以顯著提升運動質量,尤其在精細動作上優於更大規模的模型。
儘管效能強大,MolmoMotion仍存在一些侷限性。訓練時每物體僅使用8個查詢點,不足以密集表示表面幾何,限制了複雜變形運動的處理能力。研究團隊認為,運動預測對於機器智慧至關重要,MolmoMotion朝這個方向邁出了重要一步,並已開源模型權重、資料集和基準測試,供社群進一步研究和改進。