本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

GRASP:長い地平線における世界モデルのための勾配ベース計画

記事の要約

GRASPは、学習されたダイナミクス(世界モデル)のための新しい勾配ベース計画手法であり、(1)軌道を仮想状態に持ち上げて時間方向の並列最適化を可能にし、(2)状態反復に直接確率性を加えて探索を行い、(3)高次元視覚モデルを通じた脆弱な「状態入力」勾配を避けつつ行動に明確な信号を与えるために勾配を再形成することで、長い地平線の計画を実用的にする。

ソースAIhub著者: BAIR blog
GRASP:長い地平線における世界モデルのための勾配ベース計画
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

GRASP(Gradient RelAxed Stochastic Planner)は、学習された動的モデル(世界モデル)のための新しい勾配ベースの計画手法です。この研究はMichael Psenka、Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Barによって共同で行われました。

大規模な世界モデルは、高次元視覚空間における長い将来観測を予測し、タスク間で一般化する能力が向上していますが、それらを制御や計画に効果的に使用することは依然として困難です。特に長い地平線の計画では、最適化が悪条件になり、非貪欲な構造が不良な局所最適解を生み出し、高次元潜在空間が微妙な障害を引き起こします。

長い地平線計画の主な課題は、時間方向の逆伝播による勾配の爆発・消失、非貪欲な行動の必要性の増加、そして敵対的ロバスト性に起因する状態勾配の脆弱性です。GRASPは、動的制約をソフト制約として緩和し、状態と行動の両方を最適化する配置法(collocation)を採用します。これにより、各時間ステップの計算が並列化され、長い計算グラフを避けることができます。

しかし、直接状態を最適化すると、世界モデルが訓練データの多様体外の状態に対して鋭い勾配を持つため、敵対的攻撃に対して脆弱になります。GRASPの重要な洞察は、行動空間は通常低次元で十分に訓練されているため行動勾配は信頼できるのに対し、状態勾配は脆弱であるということです。そのため、GRASPは状態勾配を停止し、代わりに密な目標項を追加して勾配を再形成します。さらに、状態反復にガウス雑音を注入して探索を促進し、定期的に元の逐次目的関数と同期することで解を洗練します。

Push-Tタスクにおける実験では、GRASPは地平線長40から80のすべてで最も高い成功率を達成し、成功までの中央時間も最短でした。例えば、H=50ではGRASPの成功率43.4%(中央時間15.2秒)に対し、CEMは30.2%(96.2秒)、GDは37.6%(76.3秒)、LatCoは4.2%(1114.7秒)でした。

今後の課題として、拡散ベースの世界モデルへの拡張、より洗練された最適化手法とノイズ戦略の開発、およびGRASPを閉ループシステムや強化学習に統合することが挙げられます。著者らは、計画に関する文献は成熟しているが、大規模世界モデルへの応用はまだ未開拓であり、この分野は重要な発展の時期にあると述べています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • GRASPは動的制約を緩和して並列計算を実現し、勾配問題を緩和する。
  • 状態反復にガウス雑音を注入して探索を促進し、行動勾配はそのまま保つ。
  • 状態勾配を停止し、密な目標項を追加することで敵対的ロバスト性問題を回避する。
  • 定期的な同期ステップにより、元の逐次目的関数と整合させる。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。