在强化学习领域,时序差分(TD)学习是价值函数训练的核心方法,但其通过自举方式传播误差,导致长程任务中误差累积严重。虽然n步TD通过混合蒙特卡洛(MC)回报在一定程度上缓解了问题,但它仅线性减少递归次数,且面临方差和次优性问题。本文作者提出了一种全新的“第三范式”——分治策略,并以此为基础设计了Transitive RL(TRL)算法。
TRL的核心思想是将一条轨迹递归地分割为两个等长的子段,利用子段的价值更新完整轨迹的价值,从而将贝尔曼递归次数从线性降低为对数级别。这种方法不仅无需超参数调节,还能自然处理长程依赖。在目标条件强化学习的框架下,TRL利用三角不等式导出传递性贝尔曼更新规则:状态s到目标g的价值可通过中间子目标w的价值组合来更新。为了解决实际中如何选择最优子目标w的难题,作者将搜索空间限制在数据集轨迹中的状态,并采用期望回归(expectile regression)实现“软”最大化,避免价值过高估计。
实验部分,TRL在OGBench基准测试中最具挑战的任务(如humanoidmaze和puzzle,最高3000步)上超越了包括TD、MC、准度量学习在内的多种强基线,并且达到了与最佳调参n步TD相同的性能,而无需手动选择n值。这验证了分治范式在长程任务中的巨大潜力。
未来,作者计划将TRL扩展到通用奖励型RL任务(理论上可将任意奖励任务转化为目标条件问题),并应对随机环境(通过随机三角不等式)。同时,算法本身在子目标选择、超参数简化、训练稳定性等方面仍有改进空间。作者认为,分治与递归决策可能是实现可扩展离线RL的关键途径之一。