决策能力中的结构性阈值导致自对弈强化学习崩溃
研究发现,自对弈强化学习代理在不对称规则扰动下,当所有正到达决策点被消除时会迅速崩溃至最大损失固定点,而保留单个正到达决策点即可防止崩溃。该现象由约束下的共同适应机制驱动,与扰动本身无关,且具有时间不变性、可逆性,并在函数近似下加剧。
一篇发表在arXiv上的新研究揭示了自对弈强化学习中一个关键的决策能力阈值,该阈值决定了在不对称规则修改下系统是否会发生崩溃。该研究由Arahan Kujur撰写,于2026年5月4日提交至arXiv,共18页,包含7张图。研究团队在多种游戏环境中进行了实验,包括扑克变体、矩阵博弈和掷骰子游戏,并使用了多种学习算法。他们发现,当所有被称为“正到达”(positive-reach)的偶然决策点被消除时,学习代理会迅速收敛到一个确定性的利用吸引子——一个接近最大损失的固定点。相反,哪怕只保留一个正到达决策点,也能完全防止这种崩溃。
通过冻结基线和固定对手的控制实验,研究人员确认崩溃的根源并非扰动本身,而是约束条件下代理之间的共同适应机制。该现象具有时间不变性:无论何时施加相同的扰动,结果都一致。此外,一旦恢复被消除的决策点,崩溃过程可以完全逆转。值得注意的是,当使用函数近似(如神经网络)时,崩溃的程度会加剧,表明在更复杂的模型中脆弱性更强。
这些结果在测试领域中确立了一个清晰的阈值:零到达加权偶然行动能力。超过该阈值,崩溃的严重程度随到达加权能力的减少而连续增加。这一发现不仅为理解自对弈强化学习中的脆弱性提供了新的理论视角,而且对多智能体系统的安全部署具有重要的实践意义。研究者指出,设计者应确保代理保留至少一个正到达决策点,以避免系统崩溃。该研究也提示,在采用函数近似时需格外谨慎,因为其可能放大风险。