AI News HubLIVE
站内改写1 分钟阅读

LEACL:基于大语言模型增强的自动课程学习,用于长时域操作任务中的强化学习

本文提出LEACL框架,结合大语言模型与自动课程学习,通过分解任务和生成规格,使用稀疏奖励信号高效训练长时域操作任务。在LIBERO基准上,LEACL在成功率上优于人工设计的密集奖励。

来源arXiv Robotics作者: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

长时域操作任务在强化学习中面临重大挑战,主要因为奖励信号稀疏且时间跨度长。自动课程学习(ACL)通过从易到难逐步训练智能体来缓解这一问题,但其成功高度依赖人工设计的任务参数空间和难度度量,导致难以泛化。近年来,大语言模型(LLM)凭借丰富的常识知识,能够将复杂任务分解为有意义的子任务,为课程学习提供自然结构。然而,现有基于LLM的方法通常需要手动设计密集的奖励函数来学习每个子任务,这引入了偏差且仍需大量人工干预。

本文提出LEACL(LLM-Enhanced Automatic Curriculum Learning)框架,将LLM与ACL深度融合。LEACL利用LLM不仅分解任务,还自动生成每个子任务的依赖规格。这些规格被ACL算法利用,仅通过稀疏奖励信号指导学习,彻底消除了对密集奖励设计的依赖。研究团队在LIBERO基准的五个长时域操作任务上评估了LEACL,包括物品摆放、抽屉开关等。实验结果显示,LEACL在成功率方面显著优于使用人工设计密集奖励的方法,且收敛速度更快。

该论文由Faraz Heravi等六位作者完成,共8页,包含4张图表,已被IEEE/RSJ国际智能机器人与系统会议(IROS 2026)接收。研究代码和数据尚未公开,但论文提供了详细的算法描述和实验设置。这一工作展示了LLM在机器人学习领域的巨大潜力,为未来无需密集人工设计的课程学习方案奠定了基础。