在強化學習領域,時序差分(TD)學習是價值函式訓練的核心方法,但其透過自舉方式傳播誤差,導致長程任務中誤差累積嚴重。雖然n步TD透過混合蒙特卡洛(MC)回報在一定程度上緩解了問題,但它僅線性減少遞迴次數,且面臨方差和次優性問題。本文作者提出了一種全新的“第三正規化”——分治策略,並以此為基礎設計了Transitive RL(TRL)演算法。
TRL的核心思想是將一條軌跡遞迴地分割為兩個等長的子段,利用子段的價值更新完整軌跡的價值,從而將貝爾曼遞迴次數從線性降低為對數級別。這種方法不僅無需超引數調節,還能自然處理長程依賴。在目標條件強化學習的框架下,TRL利用三角不等式匯出傳遞性貝爾曼更新規則:狀態s到目標g的價值可透過中間子目標w的價值組合來更新。為了解決實際中如何選擇最優子目標w的難題,作者將搜尋空間限制在資料集軌跡中的狀態,並採用期望迴歸(expectile regression)實現“軟”最大化,避免價值過高估計。
實驗部分,TRL在OGBench基準測試中最具挑戰的任務(如humanoidmaze和puzzle,最高3000步)上超越了包括TD、MC、準度量學習在內的多種強基線,並且達到了與最佳調參n步TD相同的效能,而無需手動選擇n值。這驗證了分治正規化在長程任務中的巨大潛力。
未來,作者計劃將TRL擴充套件到通用獎勵型RL任務(理論上可將任意獎勵任務轉化為目標條件問題),並應對隨機環境(透過隨機三角不等式)。同時,演算法本身在子目標選擇、超引數簡化、訓練穩定性等方面仍有改進空間。作者認為,分治與遞迴決策可能是實現可擴充套件離線RL的關鍵途徑之一。