从黑盒到可执行逻辑:通过Prolog专家系统实现可解释强化学习
本文提出将深度强化学习策略转换为可执行的Prolog逻辑程序,使黑盒模型变得可解释。该方法通过三阶段后处理:提取冻结的PPO教师、归纳有序规则列表并生成Prolog程序,再通过扩展阶段优化规则。理论证明包括返回损失界限、单调改进与终止性,以及在连续观察空间中保真度的控制。实验表明,在离散任务中达到最优回报,在连续控制任务中匹配或接近神经网络性能。
强化学习中的深度神经网络策略往往被视为黑盒模型,难以理解和信任。近期一篇arXiv论文(2607.15459)提出了一种新颖的方法,将训练后的深度强化学习策略转化为可执行的Prolog逻辑程序,从而在保留性能的同时实现完全可解释性。
该方法包含三个主要阶段。首先,从冻结的近端策略优化(PPO)教师网络中提取决策行为。其次,采用经典的关系学习方式,归纳出一个有序的规则列表,捕捉教师网络的决策逻辑。最后,将规则列表输出为一个Prolog程序,该程序可以在标准逻辑引擎上运行,并且支持人工阅读和编辑。此外,研究还引入了一个扩展阶段,在此阶段可以对规则库进行编辑,但只有当我们通过策略评估确认编辑能够提升回报时才会被接受。
在理论层面,论文提供了四项关键保证。返回损失界限使蒸馏出的程序成为有限马尔可夫决策过程中可机器验证的证书。扩展循环保证单调改进并最终终止。对于连续观察空间,研究指出基于命题阈值的实例化能够以任意保真度转换网络,不一致性为O(1/B),回报差距以相同速率缩小;同时,匹配的下界表明对于斜决策边界,成本随观察维度指数增长。
实验评估在离散和连续控制任务上进行。在具有16944个可达状态的两房间钥匙门任务中,扩展后的Prolog程序在每个随机种子下都达到了精确最优回报,并且在预算受限情况下,十次运行中有十次超过了随机教师。在三个连续控制任务中,生成的程序能够替代神经网络:在Acrobot任务中用11条规则匹配了神经教师的表现,在CartPole任务中恢复了约97%的回报,而在更精细控制的LunarLander任务中仅部分恢复,这正好符合指数下界预测的上限。
这项研究展示了将深度强化学习策略转化为可读逻辑程序的可能性,为可解释强化学习提供了新的工具和理论基础。