當動作消失:自對弈強化學習中的對抗性動作移除
研究自對弈強化學習中,攻擊者通過選擇性移除合法動作來破壞智能體決策。在撲克及非撲克領域的實驗表明,學習型掩碼比隨機掩碼和擾動基線造成更大傷害,且攻擊可跨算法遷移、在自對弈中放大,且無法通過延長掩碼訓練恢復。
一篇新的研究論文《當動作消失:自對弈強化學習中的對抗性動作移除》由Arahan Kujur提交至arXiv,揭示了一種全新的攻擊方式:對抗性動作掩碼(adversarial action masking)。與傳統攻擊方法通過擾動觀測值或動作值不同,該攻擊直接在智能體行動前移除其可用的合法動作,從而消除決策選項。這種方法更為隱蔽和破壞性,因為智能體甚至無法得知可選動作被移除,只能從剩餘動作中選擇。
研究者在規模從6到5,531個信息狀態的多種撲克遊戲以及兩個非撲克領域進行了實驗。他們發現,學習型掩碼(learned masking)相比隨機掩碼和基於擾動的基線方法造成了明顯更大的傷害。具體而言,攻擊者通過學習一個掩碼策略,選擇性地移除那些對智能體決策至關重要的動作,從而最大化性能損失。實驗覆蓋了多種強化學習算法,包括Q學習、PPO、NFSP、神經NFSP和DQN,結果表明攻擊在所有算法上均有效。進一步地,攻擊可以在不同智能體之間遷移,即針對一個智能體訓練的掩碼策略可以成功應用於另一個智能體。更重要的是,當智能體進行自對弈訓練時,攻擊效果會被放大,因為自對弈過程中的對手也是攻擊者,形成惡性循環。即使受害智能體在長時間使用掩碼訓練後,其性能也無法恢復,表明這種攻擊具有持久性。
為了理解攻擊的機制,研究者提出了兩個度量指標:基於可達性的加權條件動作容量(CAC_w)和基於值的加權改進(CAC_v)。CAC_w衡量在給定狀態和可達性條件下,被移除動作的重要程度,而CAC_v則進一步基於價值函數加權。這些指標揭示了攻擊者針對的是高價值決策點,即那些在決策過程中具有最大影響力的動作。最後,這項研究強調了“動作可用性”(action availability)作為自對弈強化學習中一個獨立的魯棒性表面,值得進一步研究。論文共有17頁、2張圖和18張表格,目前可在arXiv上獲取(arXiv:2605.16312)。