面向长周期智能体任务的进度条件组策略优化
一种名为ProGPO的新方法,通过在组内所有轨迹都失败时利用首次访问观测覆盖率来分配优势,解决了基于组的策略优化中的采样不平衡问题,从而提升了长周期任务的性能。
在训练大语言模型(LLM)智能体执行复杂的长周期任务时,稀疏的结果奖励通常通过组内轨迹或步骤的比较来指导策略优化。然而,这种方法在困难任务中面临严重的采样不平衡问题:重复或低效的动作占据了策略的高概率区域,而真正能改变状态的有用动作却被采样不足。这种不平衡导致大量全失败的组,结果奖励无法提供任何修正方向。更糟糕的是,这些效应会形成自我强化的信用陷阱——失败主导的采样无法产生基于结果的修正,使得重复的低效动作持续存在。
为打破这一循环,Kaibing Yang等研究者提出了进度条件组策略优化(ProGPO)。ProGPO的核心创新在于,当组内所有样本都获得零结果奖励时,它仅通过首次访问观测覆盖率来分配优势。具体地,在这样的组中,ProGPO为那些访问更多新状态的轨迹或步骤赋予更高的相对优势,因为到达新观测是任务成功的前提。这种方法避免了传统组策略中奖励信号缺失时的盲目性,为策略提供了基于探索进度的信号。
实验在ALFWorld和WebShop两个挑战性基准上进行,使用Qwen2.5-1.5B和Qwen2.5-7B-Instruct模型。结果表明,ProGPO在所有任务上一致优于现有的组策略基线,尤其在困难任务上表现出显著提升。例如,在ALFWorld中,ProGPO在困难场景下将成功率提升了约10个百分点。该方法有效缓解了采样不平衡问题,为训练长周期智能体提供了一种实用且有效的改进方案。
详细来说,ProGPO基于以下观察:在长周期任务中,智能体需要执行一系列动作才能获得首次成功信号。传统组策略比较组内轨迹,但当所有轨迹都失败时,无法区分哪条轨迹更接近成功。ProGPO通过记录每个观测是否首次被访问,来量化探索进度。如果一个轨迹探索了更多新状态,即使最终失败,它也被认为更有潜力,因此获得更高的优势。这种优势分配策略引导策略向探索新状态的方向更新,从而逐渐逃离重复低效动作的陷阱。
此外,ProGPO的实现简洁高效,仅需在现有组策略框架上增加一个基于观测集的计数模块,无需额外计算昂贵的价值函数。这使得它易于集成到现有的训练流程中。论文还分析了采样不平衡的根源,证明在稀疏奖励的长周期任务中,优势函数的标准估计会因大量全失败组而失效,而ProGPO的优势估计提供了更可靠的梯度信号。
这篇论文于2026年7月22日提交至arXiv,属于机器学习(cs.LG)和人工智能(cs.AI)领域。它提供了一种针对长周期任务中组策略优化缺陷的解决方案,有望推动LLM智能体在复杂环境中的应用。未来工作可探索将ProGPO与其他探索激励(如内在奖励)结合,或扩展到多智能体场景。