跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

無需時序差分的強化學習:分治策略的突破

文章摘要

本文介紹了一種基於分治正規化的新型強化學習演算法——Transitive RL(TRL),它完全摒棄了傳統的時序差分學習,透過遞迴分割軌跡實現對長程任務的強擴充套件性。在OGBench最具挑戰性的任務上,TRL達到了最優效能,且無需手動調整n步TD的超引數。

來源BAIR Blog
無需時序差分的強化學習:分治策略的突破
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在強化學習領域,時序差分(TD)學習是價值函式訓練的核心方法,但其透過自舉方式傳播誤差,導致長程任務中誤差累積嚴重。雖然n步TD透過混合蒙特卡洛(MC)回報在一定程度上緩解了問題,但它僅線性減少遞迴次數,且面臨方差和次優性問題。本文作者提出了一種全新的“第三正規化”——分治策略,並以此為基礎設計了Transitive RL(TRL)演算法。

TRL的核心思想是將一條軌跡遞迴地分割為兩個等長的子段,利用子段的價值更新完整軌跡的價值,從而將貝爾曼遞迴次數從線性降低為對數級別。這種方法不僅無需超引數調節,還能自然處理長程依賴。在目標條件強化學習的框架下,TRL利用三角不等式匯出傳遞性貝爾曼更新規則:狀態s到目標g的價值可透過中間子目標w的價值組合來更新。為了解決實際中如何選擇最優子目標w的難題,作者將搜尋空間限制在資料集軌跡中的狀態,並採用期望迴歸(expectile regression)實現“軟”最大化,避免價值過高估計。

實驗部分,TRL在OGBench基準測試中最具挑戰的任務(如humanoidmaze和puzzle,最高3000步)上超越了包括TD、MC、準度量學習在內的多種強基線,並且達到了與最佳調參n步TD相同的效能,而無需手動選擇n值。這驗證了分治正規化在長程任務中的巨大潛力。

未來,作者計劃將TRL擴充套件到通用獎勵型RL任務(理論上可將任意獎勵任務轉化為目標條件問題),並應對隨機環境(透過隨機三角不等式)。同時,演算法本身在子目標選擇、超引數簡化、訓練穩定性等方面仍有改進空間。作者認為,分治與遞迴決策可能是實現可擴充套件離線RL的關鍵途徑之一。

展開要點與分析

文章情報

工程師進階

要點

  • 提出基於分治策略的強化學習演算法TRL,替代傳統的時序差分學習。
  • TRL透過遞迴分割軌跡,將貝爾曼遞迴次數從線性降低為對數級別,有效處理長程任務。
  • 在OGBench基準測試中,TRL在最具挑戰性的任務上取得了最佳效能,且無需調整n步TD的超引數。
  • 未來工作包括擴充套件到獎勵型RL和隨機環境,以及進一步最佳化演算法。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。