GRASP(Gradient RelAxed Stochastic Planner)是一種針對學習型動力學模型(即世界模型)的新型梯度規劃器,由Michael Psenka與Mike Rabbat、Aditi Krishnapriyan、Yann LeCun及Amir Bar合作完成。該工作旨在解決長視界規劃中的關鍵難題,使基於梯度的規劃在大規模世界模型上變得更加實用。
隨著世界模型規模的擴大,它們能夠預測高維視覺空間中的長序列未來觀測,並跨任務泛化,但將其有效用於控制或規劃仍面臨脆弱性:最佳化變得病態,非貪婪結構導致區域性最優,高維潛在空間引入細微失敗模式。
長視界規劃的主要挑戰包括:首先,透過時間反向傳播會導致梯度爆炸或消失,因為雅可比矩陣的條件數隨視界指數增長。其次,任務越長,越需要非貪婪行為(如繞行),且最佳化空間維度增加,區域性最優陷阱增多。更為關鍵的是,對於基於深度學習的世界模型,直接最佳化狀態輸入會引發對抗魯棒性問題:世界模型對狀態輸入的梯度非常敏感,因為訓練資料流形外的方向可能產生尖銳梯度,使得模型容易被愚弄。
針對這些問題,文章提出將動力學約束鬆弛為軟約束,採用配置法(collocation)最佳化動作和狀態序列,從而將深度計算圖拆解為可平行計算的區域性項,同時避免長鏈反向傳播。然而,直接最佳化狀態會導致對抗魯棒性問題,因為世界模型在訓練資料流形外的方向上梯度尖銳。
GRASP的核心洞察是,動作空間通常低維且被充分訓練,因此動作梯度可靠;而狀態梯度脆弱。因此,GRASP僅依賴動作雅可比,透過停止狀態梯度並新增密集目標項來重塑損失函式。具體地,它結合了停止梯度的動力學損失和密集目標損失,並定期與原始序列目標同步微調。此外,GRASP在狀態迭代中注入高斯噪聲以增強探索,幫助跳出區域性最優。
在Push-T任務上的實驗顯示,GRASP在視界長度從40到80時均取得最高成功率,且中位成功時間最短。例如,在H=50時,GRASP成功率43.4%(耗時15.2秒),而CEM為30.2%(96.2秒)、GD為37.6%(76.3秒)、LatCo僅4.2%(1114.7秒)。這些結果證明了GRASP在長視界規劃中的有效性和效率。
未來工作包括擴充套件到擴散世界模型、採用更復雜的最佳化器與噪聲策略,以及將GRASP整合到閉環系統或強化學習策略中。作者認為,世界模型規劃器正處於文獻成熟但實際應用未充分探索的黃金時期,GRASP是邁向實用化的重要一步。