跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

无需时序差分的强化学习:分治策略的突破

文章摘要

本文介绍了一种基于分治范式的新型强化学习算法——Transitive RL(TRL),它完全摒弃了传统的时序差分学习,通过递归分割轨迹实现对长程任务的强扩展性。在OGBench最具挑战性的任务上,TRL达到了最优性能,且无需手动调整n步TD的超参数。

来源BAIR Blog
无需时序差分的强化学习:分治策略的突破
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

在强化学习领域,时序差分(TD)学习是价值函数训练的核心方法,但其通过自举方式传播误差,导致长程任务中误差累积严重。虽然n步TD通过混合蒙特卡洛(MC)回报在一定程度上缓解了问题,但它仅线性减少递归次数,且面临方差和次优性问题。本文作者提出了一种全新的“第三范式”——分治策略,并以此为基础设计了Transitive RL(TRL)算法。

TRL的核心思想是将一条轨迹递归地分割为两个等长的子段,利用子段的价值更新完整轨迹的价值,从而将贝尔曼递归次数从线性降低为对数级别。这种方法不仅无需超参数调节,还能自然处理长程依赖。在目标条件强化学习的框架下,TRL利用三角不等式导出传递性贝尔曼更新规则:状态s到目标g的价值可通过中间子目标w的价值组合来更新。为了解决实际中如何选择最优子目标w的难题,作者将搜索空间限制在数据集轨迹中的状态,并采用期望回归(expectile regression)实现“软”最大化,避免价值过高估计。

实验部分,TRL在OGBench基准测试中最具挑战的任务(如humanoidmaze和puzzle,最高3000步)上超越了包括TD、MC、准度量学习在内的多种强基线,并且达到了与最佳调参n步TD相同的性能,而无需手动选择n值。这验证了分治范式在长程任务中的巨大潜力。

未来,作者计划将TRL扩展到通用奖励型RL任务(理论上可将任意奖励任务转化为目标条件问题),并应对随机环境(通过随机三角不等式)。同时,算法本身在子目标选择、超参数简化、训练稳定性等方面仍有改进空间。作者认为,分治与递归决策可能是实现可扩展离线RL的关键途径之一。

展开要点与分析

文章情报

工程师进阶

要点

  • 提出基于分治策略的强化学习算法TRL,替代传统的时序差分学习。
  • TRL通过递归分割轨迹,将贝尔曼递归次数从线性降低为对数级别,有效处理长程任务。
  • 在OGBench基准测试中,TRL在最具挑战性的任务上取得了最佳性能,且无需调整n步TD的超参数。
  • 未来工作包括扩展到奖励型RL和随机环境,以及进一步优化算法。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。