GRASP(Gradient RelAxed Stochastic Planner)は、学習された動的モデル(世界モデル)のための新しい勾配ベースの計画手法です。この研究はMichael Psenka、Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Barによって共同で行われました。
大規模な世界モデルは、高次元視覚空間における長い将来観測を予測し、タスク間で一般化する能力が向上していますが、それらを制御や計画に効果的に使用することは依然として困難です。特に長い地平線の計画では、最適化が悪条件になり、非貪欲な構造が不良な局所最適解を生み出し、高次元潜在空間が微妙な障害を引き起こします。
長い地平線計画の主な課題は、時間方向の逆伝播による勾配の爆発・消失、非貪欲な行動の必要性の増加、そして敵対的ロバスト性に起因する状態勾配の脆弱性です。GRASPは、動的制約をソフト制約として緩和し、状態と行動の両方を最適化する配置法(collocation)を採用します。これにより、各時間ステップの計算が並列化され、長い計算グラフを避けることができます。
しかし、直接状態を最適化すると、世界モデルが訓練データの多様体外の状態に対して鋭い勾配を持つため、敵対的攻撃に対して脆弱になります。GRASPの重要な洞察は、行動空間は通常低次元で十分に訓練されているため行動勾配は信頼できるのに対し、状態勾配は脆弱であるということです。そのため、GRASPは状態勾配を停止し、代わりに密な目標項を追加して勾配を再形成します。さらに、状態反復にガウス雑音を注入して探索を促進し、定期的に元の逐次目的関数と同期することで解を洗練します。
Push-Tタスクにおける実験では、GRASPは地平線長40から80のすべてで最も高い成功率を達成し、成功までの中央時間も最短でした。例えば、H=50ではGRASPの成功率43.4%(中央時間15.2秒)に対し、CEMは30.2%(96.2秒)、GDは37.6%(76.3秒)、LatCoは4.2%(1114.7秒)でした。
今後の課題として、拡散ベースの世界モデルへの拡張、より洗練された最適化手法とノイズ戦略の開発、およびGRASPを閉ループシステムや強化学習に統合することが挙げられます。著者らは、計画に関する文献は成熟しているが、大規模世界モデルへの応用はまだ未開拓であり、この分野は重要な発展の時期にあると述べています。