AI News HubLIVE
站内改写1 分钟阅读

当动作消失:自对弈强化学习中的对抗性动作移除

研究自对弈强化学习中,攻击者通过选择性移除合法动作来破坏智能体决策。在扑克及非扑克领域的实验表明,学习型掩码比随机掩码和扰动基线造成更大伤害,且攻击可跨算法迁移、在自对弈中放大,且无法通过延长掩码训练恢复。

来源arXiv Machine Learning作者: Arahan Kujur

一篇新的研究论文《当动作消失:自对弈强化学习中的对抗性动作移除》由Arahan Kujur提交至arXiv,揭示了一种全新的攻击方式:对抗性动作掩码(adversarial action masking)。与传统攻击方法通过扰动观测值或动作值不同,该攻击直接在智能体行动前移除其可用的合法动作,从而消除决策选项。这种方法更为隐蔽和破坏性,因为智能体甚至无法得知可选动作被移除,只能从剩余动作中选择。

研究者在规模从6到5,531个信息状态的多种扑克游戏以及两个非扑克领域进行了实验。他们发现,学习型掩码(learned masking)相比随机掩码和基于扰动的基线方法造成了明显更大的伤害。具体而言,攻击者通过学习一个掩码策略,选择性地移除那些对智能体决策至关重要的动作,从而最大化性能损失。实验覆盖了多种强化学习算法,包括Q学习、PPO、NFSP、神经NFSP和DQN,结果表明攻击在所有算法上均有效。进一步地,攻击可以在不同智能体之间迁移,即针对一个智能体训练的掩码策略可以成功应用于另一个智能体。更重要的是,当智能体进行自对弈训练时,攻击效果会被放大,因为自对弈过程中的对手也是攻击者,形成恶性循环。即使受害智能体在长时间使用掩码训练后,其性能也无法恢复,表明这种攻击具有持久性。

为了理解攻击的机制,研究者提出了两个度量指标:基于可达性的加权条件动作容量(CAC_w)和基于值的加权改进(CAC_v)。CAC_w衡量在给定状态和可达性条件下,被移除动作的重要程度,而CAC_v则进一步基于价值函数加权。这些指标揭示了攻击者针对的是高价值决策点,即那些在决策过程中具有最大影响力的动作。最后,这项研究强调了“动作可用性”(action availability)作为自对弈强化学习中一个独立的鲁棒性表面,值得进一步研究。论文共有17页、2张图和18张表格,目前可在arXiv上获取(arXiv:2605.16312)。