AI News HubLIVE
站內改寫1 分鐘閱讀

決策能力中的結構性閾值導致自對弈強化學習崩潰

研究發現,自對弈強化學習代理在不對稱規則擾動下,當所有正到達決策點被消除時會迅速崩潰至最大損失固定點,而保留單個正到達決策點即可防止崩潰。該現象由約束下的共同適應機制驅動,與擾動本身無關,且具有時間不變性、可逆性,並在函式近似下加劇。

來源arXiv Machine Learning作者: Arahan Kujur

一篇發表在arXiv上的新研究揭示了自對弈強化學習中一個關鍵的決策能力閾值,該閾值決定了在不對稱規則修改下系統是否會發生崩潰。該研究由Arahan Kujur撰寫,於2026年5月4日提交至arXiv,共18頁,包含7張圖。研究團隊在多種遊戲環境中進行了實驗,包括撲克變體、矩陣博弈和擲骰子游戲,並使用了多種學習演算法。他們發現,當所有被稱為“正到達”(positive-reach)的偶然決策點被消除時,學習代理會迅速收斂到一個確定性的利用吸引子——一個接近最大損失的固定點。相反,哪怕只保留一個正到達決策點,也能完全防止這種崩潰。

透過凍結基線和固定對手的控制實驗,研究人員確認崩潰的根源並非擾動本身,而是約束條件下代理之間的共同適應機制。該現象具有時間不變性:無論何時施加相同的擾動,結果都一致。此外,一旦恢復被消除的決策點,崩潰過程可以完全逆轉。值得注意的是,當使用函式近似(如神經網路)時,崩潰的程度會加劇,表明在更復雜的模型中脆弱性更強。

這些結果在測試領域中確立了一個清晰的閾值:零到達加權偶然行動能力。超過該閾值,崩潰的嚴重程度隨到達加權能力的減少而連續增加。這一發現不僅為理解自對弈強化學習中的脆弱性提供了新的理論視角,而且對多智慧體系統的安全部署具有重要的實踐意義。研究者指出,設計者應確保代理保留至少一個正到達決策點,以避免系統崩潰。該研究也提示,在採用函式近似時需格外謹慎,因為其可能放大風險。