強化学習において、時間差(TD)学習は価値関数の訓練に広く用いられていますが、ブートストラップによる誤差の蓄積が長期的タスクのスケーラビリティを制限しています。nステップTDはモンテカルロ法を部分的に取り入れますが、線形な改善に留まり、分散や次善性の問題があります。本稿では、第三のパラダイムとして分割統治を提案し、Transitive RL(TRL)を設計しました。TRLは軌跡を二等分し、各部分の価値を組み合わせて全体の価値を更新します。これにより、ベルマン再帰の回数が対数的に減少し、長期タスクに自然に対応できます。ハイパーパラメータも不要です。
TRLは目標条件付き強化学習における三角不等式を利用し、状態sから目標gへの価値を中間目標wの価値で更新します。実用上の課題である最適なwの選択に対しては、データセット内の状態に探索を制限し、期待値回帰を用いたソフトな最大化を採用することで、価値の過大評価を防ぎます。
OGBenchの最も困難なタスク(humanoidmaze、puzzle、最大3000ステップ)において、TRLはTD、MC、準距離学習などの強力なベースラインを凌駕し、最適に調整されたnステップTDと同等の性能を達成しました。これは分割統治パラダイムの有効性を強く示しています。
今後の研究では、TRLを一般的な報酬ベースのタスクに拡張すること(理論上は任意のタスクを目標条件付きに変換可能)や、確率的環境への対応(確率的三角不等式の活用)が重要です。また、アルゴリズム自体の改善(サブゴール選択の洗練、ハイパーパラメータ削減、安定性向上)も期待されます。著者は、分割統治と再帰的決定がスケーラブルなオフポリシー強化学習の鍵であると考えています。