跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

GRASP:基於梯度的長視界世界模型規劃器

文章摘要

GRASP是一種針對學習型動力學(世界模型)的新型梯度規劃器,通過提升軌跡到虛擬狀態實現時間並行優化、在狀態迭代中加入隨機性以探索、重塑梯度以避免高維視覺模型中的脆弱狀態輸入梯度,使長視界規劃變得實用。文章詳細分析了長視界規劃面臨的梯度爆炸/消失、非貪婪局部最優以及對抗魯棒性問題,並介紹了GRASP的解決方案。

來源AIhub作者: BAIR blog
GRASP:基於梯度的長視界世界模型規劃器
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

GRASP(Gradient RelAxed Stochastic Planner)是一種針對學習型動力學模型(即世界模型)的新型梯度規劃器,由Michael Psenka與Mike Rabbat、Aditi Krishnapriyan、Yann LeCun及Amir Bar合作完成。該工作旨在解決長視界規劃中的關鍵難題,使基於梯度的規劃在大規模世界模型上變得更加實用。

隨着世界模型規模的擴大,它們能夠預測高維視覺空間中的長序列未來觀測,並跨任務泛化,但將其有效用於控制或規劃仍面臨脆弱性:優化變得病態,非貪婪結構導致局部最優,高維潛在空間引入細微失敗模式。

長視界規劃的主要挑戰包括:首先,通過時間反向傳播會導致梯度爆炸或消失,因為雅可比矩陣的條件數隨視界指數增長。其次,任務越長,越需要非貪婪行為(如繞行),且優化空間維度增加,局部最優陷阱增多。更為關鍵的是,對於基於深度學習的世界模型,直接優化狀態輸入會引發對抗魯棒性問題:世界模型對狀態輸入的梯度非常敏感,因為訓練數據流形外的方向可能產生尖鋭梯度,使得模型容易被愚弄。

針對這些問題,文章提出將動力學約束鬆弛為軟約束,採用配置法(collocation)優化動作和狀態序列,從而將深度計算圖拆解為可並行計算的局部項,同時避免長鏈反向傳播。然而,直接優化狀態會導致對抗魯棒性問題,因為世界模型在訓練數據流形外的方向上梯度尖鋭。

GRASP的核心洞察是,動作空間通常低維且被充分訓練,因此動作梯度可靠;而狀態梯度脆弱。因此,GRASP僅依賴動作雅可比,通過停止狀態梯度並添加密集目標項來重塑損失函數。具體地,它結合了停止梯度的動力學損失和密集目標損失,並定期與原始串行目標同步微調。此外,GRASP在狀態迭代中注入高斯噪聲以增強探索,幫助跳出局部最優。

在Push-T任務上的實驗顯示,GRASP在視界長度從40到80時均取得最高成功率,且中位成功時間最短。例如,在H=50時,GRASP成功率43.4%(耗時15.2秒),而CEM為30.2%(96.2秒)、GD為37.6%(76.3秒)、LatCo僅4.2%(1114.7秒)。這些結果證明了GRASP在長視界規劃中的有效性和效率。

未來工作包括擴展到擴散世界模型、採用更復雜的優化器與噪聲策略,以及將GRASP集成到閉環系統或強化學習策略中。作者認為,世界模型規劃器正處於文獻成熟但實際應用未充分探索的黃金時期,GRASP是邁向實用化的重要一步。

展開要點與分析

文章情報

工程師進階

要點

  • GRASP通過提升動力學約束為軟約束,實現時間並行計算,緩解長視界帶來的梯度問題。
  • 在狀態優化中注入高斯噪聲,幫助跳出局部最優,同時保持動作梯度清晰。
  • 通過停止狀態梯度並引入密集目標項,避免對抗性魯棒問題,並定期與真實軌跡同步。
  • 實驗表明,GRASP在長視界任務中成功率更高且耗時更短。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。