安全约束的强化学习与训练后可达性验证用于机器人导航
研究人员提出了一种用于机器人导航的安全强化学习框架,该框架在训练过程中使用条件风险价值(CVaR)约束,并在训练后通过神经网络可达性验证来确保安全裕度。该方法在仿真中实现了98.3%的成功率,并成功迁移到真实机器人上。
在机器人导航领域,安全性是部署自主系统的关键挑战。传统的强化学习方法通常使用平均累积成本来评估安全策略,然而这种指标可能掩盖高成本的尾部风险行为。为了解决这一问题,来自Qisong He等七位研究者的工作提出了一种结合条件风险价值(CVaR)约束优化与训练后可达性验证的安全强化学习框架。
该框架基于离策略的TD3算法,在训练过程中引入CVaR约束,使得策略对高成本的尾部结果更加敏感,而不是仅仅优化平均表现。具体来说,CVaR约束要求策略在累积成本分布的高尾部分保持较低的风险,从而在数学上保证策略对极端事件的鲁棒性。训练完成后,研究者采用泰勒模型分析,在合理的观测不确定性假设下计算策略的动作可达集合。通过定义安全率指标,量化在评估状态下策略的可达动作集保持在预设安全边界内的比例。
实验在十个不同的导航场景中进行,与六个基线方法(包括无约束、标准成本约束等)的对比表明,CVaR约束训练的策略在评估状态下保持了更大的障碍物安全裕度。该方法达到了98.3%的成功率,在所有对比方法中安全验证率最高。更重要的是,研究发现平均成本排名与基于可达性的安全排名可能产生分歧,这表明可达性验证能够捕捉到仅靠经验成本指标无法识别的风险,为安全评估提供了更全面的视角。
为了验证方法在实际环境中的可行性,研究团队在Clearpath Jackal地面机器人上进行了实物实验。机器人搭载了有限的传感器,在室内环境中执行导航任务,成功实现了从仿真到现实的迁移。这一工作不仅为移动机器人导航提供了更可靠的安全保障,也为后续研究将形式化验证与风险敏感学习相结合提供了重要范式。