深度強化學習中凍結隨機CNN特徵提取器的自發稀疏性
研究人員發現,使用凍結隨機CNN特徵提取器的深度強化學習智能體,在沒有任何稀疏性誘導目標的情況下,會自發地在全連接層中產生極度稀疏的表徵。在確定性的Pong遊戲中,64個神經元中僅1-3個被激活,而可訓練的CNN在相同條件下激活55-64個。稀疏性程度隨任務複雜度變化,且隨機種子會導致不同的稀疏模式。移除這些活躍神經元會導致性能崩潰,而活躍集在訓練早期就已鎖定。該現象揭示了輸入維度遠大於任務固有維度時,梯度下降在凍結隨機投影上可以揭示問題的有效秩,無需顯式的稀疏性機制。
一項新研究發現,在深度強化學習(DRL)中,使用凍結的、隨機初始化的卷積神經網絡(CNN)特徵提取器的智能體,會自發地發展出極度稀疏的全連接層表徵,而無需任何顯式的稀疏性誘導目標。這一發現挑戰了傳統認知,即隨機特徵提取器只能產生雜亂無章的表徵,而可訓練的特徵提取器才能學習到有效的結構。
實驗表明,在經典的Atari遊戲環境中,當使用凍結的隨機CNN時,智能體的第一個全連接層(FC1,從3136維映射到64維)中,僅有極少數神經元被激活。例如,在確定性的Pong遊戲中,64個神經元中只有1-3個被用於壓縮任務相關信息,而在隨機版本的Pong中,這一數字為5-11個。相比之下,如果CNN特徵提取器是可訓練的,則在相同條件下會有55-64個神經元被激活。
研究者總結了四個主要發現。首先,FC1層的稀疏程度與任務複雜度密切相關:Pong遊戲有1-11個活躍神經元,Breakout有19-26個,而Space Invaders約有42個。通過改變網絡寬度,他們確認這種稀疏性反映了任務結構,而非固定的容量比例。其次,同一遊戲內也存在尺度變化:三次使用不同隨機種子的Pong實驗分別產生了5、7和11個活躍神經元。有趣的是,僅有5個活躍神經元的種子在訓練中獎勵停留在+14,而其他兩種種子達到了專家級別的+18.4和+18.7,這表明隨機投影的可用維度限制了可達性能的上限。
第三,通過消融實驗,研究者確認了這些活躍神經元的必要性。在兩種不同的PPO實現和四個遊戲中,移除這些活躍神經元都會導致性能完全崩潰,説明它們承載了任務的關鍵信息。第四,信息瓶頸的形成時間很早:通過掃描實驗發現,活躍集在訓練的前1500萬到3000萬步中就已經鎖定,而獎勵變為正值則要晚3500萬到10500萬步。這意味着智能體先確定了使用哪些神經元,然後才學會如何利用它們。
此外,在Breakout遊戲中,研究者發現了一個互補現象:使用凍結CNN的智能體與可訓練CNN的智能體達到了相當的獎勵水平,但通過結構不同的信息瓶頸實現。凍結CNN使用17-25個活躍神經元(參與比率約10-14),而可訓練CNN使用51個(參與比率約3.6)。這表明隨機投影可以引導智能體找到一種更緊湊的表徵方式。
總的來説,這項研究揭示了當輸入維度遠大於任務內在維度時,梯度下降作用於一個凍結的隨機投影可以揭示問題的有效秩,而無需顯式的稀疏性機制。這一發現不僅深化了對深度強化學習內部工作機制的理解,還可能啓發新的算法設計,例如通過有意引入隨機性來強制稀疏表徵,從而提高計算效率和泛化能力。