跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

無需時序差分的強化學習:分治策略的突破

文章摘要

本文介紹了一種基於分治範式的新型強化學習算法——Transitive RL(TRL),它完全摒棄了傳統的時序差分學習,通過遞歸分割軌跡實現對長程任務的強擴展性。在OGBench最具挑戰性的任務上,TRL達到了最優性能,且無需手動調整n步TD的超參數。

來源BAIR Blog
無需時序差分的強化學習:分治策略的突破
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在強化學習領域,時序差分(TD)學習是價值函數訓練的核心方法,但其通過自舉方式傳播誤差,導致長程任務中誤差累積嚴重。雖然n步TD通過混合蒙特卡洛(MC)回報在一定程度上緩解了問題,但它僅線性減少遞歸次數,且面臨方差和次優性問題。本文作者提出了一種全新的“第三範式”——分治策略,並以此為基礎設計了Transitive RL(TRL)算法。

TRL的核心思想是將一條軌跡遞歸地分割為兩個等長的子段,利用子段的價值更新完整軌跡的價值,從而將貝爾曼遞歸次數從線性降低為對數級別。這種方法不僅無需超參數調節,還能自然處理長程依賴。在目標條件強化學習的框架下,TRL利用三角不等式導出傳遞性貝爾曼更新規則:狀態s到目標g的價值可通過中間子目標w的價值組合來更新。為了解決實際中如何選擇最優子目標w的難題,作者將搜索空間限制在數據集軌跡中的狀態,並採用期望迴歸(expectile regression)實現“軟”最大化,避免價值過高估計。

實驗部分,TRL在OGBench基準測試中最具挑戰的任務(如humanoidmaze和puzzle,最高3000步)上超越了包括TD、MC、準度量學習在內的多種強基線,並且達到了與最佳調參n步TD相同的性能,而無需手動選擇n值。這驗證了分治範式在長程任務中的巨大潛力。

未來,作者計劃將TRL擴展到通用獎勵型RL任務(理論上可將任意獎勵任務轉化為目標條件問題),並應對隨機環境(通過隨機三角不等式)。同時,算法本身在子目標選擇、超參數簡化、訓練穩定性等方面仍有改進空間。作者認為,分治與遞歸決策可能是實現可擴展離線RL的關鍵途徑之一。

展開要點與分析

文章情報

工程師進階

要點

  • 提出基於分治策略的強化學習算法TRL,替代傳統的時序差分學習。
  • TRL通過遞歸分割軌跡,將貝爾曼遞歸次數從線性降低為對數級別,有效處理長程任務。
  • 在OGBench基準測試中,TRL在最具挑戰性的任務上取得了最佳性能,且無需調整n步TD的超參數。
  • 未來工作包括擴展到獎勵型RL和隨機環境,以及進一步優化算法。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。