AI News HubLIVE
站内改写1 分钟阅读

学习何时行动:通过运行时保障实现通信高效的强化学习

该研究提出了一种新的安全强化学习方法,通过运行时保障(RTA)层和Lyapunov稳定性理论,让智能体在保证安全的同时,自适应地决定何时发送控制信号,从而显著降低通信频率。在倒立摆、小车-杆和平面四旋翼飞行器上,该方法比Lyapunov触发基线实现了1.45到3.51倍的平均采样间隔提升。固定频率的LQR控制器在同一平均速率下不稳定,表明自适应时序而非低平均速率是实现安全稀疏控制的关键。该方法还支持偏好调节,并以2/11的训练成本重建完整的权衡曲线,且对质量变化和扰动具有鲁棒性。

来源arXiv Machine Learning作者: Adam Haroon, Erick J. Rodr\'iguez-Seda, Cody Fleming, Tristan Schuler

在传统安全强化学习中,研究者通常关注智能体“如何”执行动作以满足安全约束。然而,一篇由Adam Haroon等人提交至arXiv的新论文提出了一个根本性的问题转变:“何时”智能体才需要采取行动?作者证明,通过结合点态Lyapunov安全防护与运行时保障(RTA)层,单一策略可以同时学习最优控制输入和通信高效的时序决策。

该方法专注于已知平衡点附近的稳定化控制问题。在该设定下,基于CARE(Control Authority Restoration and Enforcement)的LQR备份、Lyapunov证书以及经典的Lyapunov-STC(Self-Triggered Control)均有严格定义,从而能够与理论分析基线进行清晰对比。RTA层通过一步前向Lyapunov预测和预计算的LQR备份来覆盖学习策略,提供比仅保证期望安全的约束MDP更强的安全保障。

实验在三个典型动力系统上展开:倒立摆、小车-杆和平面四旋翼飞行器。学习策略的平均采样间隔(MSI)分别比Lyapunov触发基线高出1.91倍、1.45倍和3.51倍。值得注意的是,以相同平均采样率运行的固定LQR控制器在所有三个系统中均不稳定,这一结果有力地表明:实现安全稀疏控制的关键在于自适应时序,而非简单地降低平均采样率。

通过CARE导出的Lyapunov奖励函数无需重新设计即可在不同环境间迁移,单个权重w_c即可控制稳定性与通信效率之间的权衡。消融实验证实了RTA防护的必要性:去除RTA后MSI降低1.27–1.84倍,且状态范数显著恶化。进一步,研究者引入偏好条件扩展,使得单个模型能够以仅2/11的训练计算量重建完整的权衡前沿。SAC实验表明,该结果在离散和连续动作空间中均具有算法无关性。

最后,论文通过一个12状态的3D四旋翼飞行器案例研究,将框架扩展至经典STC难以处理的高维系统。实验表明该方法对±30%的质量变化和外部扰动表现出优雅退化行为——当学习策略无法应对时,RTA层能够有效吸收风险。这项研究为通信受限环境下的安全控制提供了全新的理论框架与实用工具。