深度強化學習中凍結隨機CNN特徵提取器的自發稀疏性
研究人員發現,使用凍結隨機CNN特徵提取器的深度強化學習智慧體,在沒有任何稀疏性誘導目標的情況下,會自發地在全連線層中產生極度稀疏的表徵。在確定性的Pong遊戲中,64個神經元中僅1-3個被啟用,而可訓練的CNN在相同條件下啟用55-64個。稀疏性程度隨任務複雜度變化,且隨機種子會導致不同的稀疏模式。移除這些活躍神經元會導致效能崩潰,而活躍集在訓練早期就已鎖定。該現象揭示了輸入維度遠大於任務固有維度時,梯度下降在凍結隨機投影上可以揭示問題的有效秩,無需顯式的稀疏性機制。
一項新研究發現,在深度強化學習(DRL)中,使用凍結的、隨機初始化的卷積神經網路(CNN)特徵提取器的智慧體,會自發地發展出極度稀疏的全連線層表徵,而無需任何顯式的稀疏性誘導目標。這一發現挑戰了傳統認知,即隨機特徵提取器只能產生雜亂無章的表徵,而可訓練的特徵提取器才能學習到有效的結構。
實驗表明,在經典的Atari遊戲環境中,當使用凍結的隨機CNN時,智慧體的第一個全連線層(FC1,從3136維對映到64維)中,僅有極少數神經元被啟用。例如,在確定性的Pong遊戲中,64個神經元中只有1-3個被用於壓縮任務相關資訊,而在隨機版本的Pong中,這一數字為5-11個。相比之下,如果CNN特徵提取器是可訓練的,則在相同條件下會有55-64個神經元被啟用。
研究者總結了四個主要發現。首先,FC1層的稀疏程度與任務複雜度密切相關:Pong遊戲有1-11個活躍神經元,Breakout有19-26個,而Space Invaders約有42個。透過改變網路寬度,他們確認這種稀疏性反映了任務結構,而非固定的容量比例。其次,同一遊戲內也存在尺度變化:三次使用不同隨機種子的Pong實驗分別產生了5、7和11個活躍神經元。有趣的是,僅有5個活躍神經元的種子在訓練中獎勵停留在+14,而其他兩種種子達到了專家級別的+18.4和+18.7,這表明隨機投影的可用維度限制了可達效能的上限。
第三,透過消融實驗,研究者確認了這些活躍神經元的必要性。在兩種不同的PPO實現和四個遊戲中,移除這些活躍神經元都會導致效能完全崩潰,說明它們承載了任務的關鍵資訊。第四,資訊瓶頸的形成時間很早:透過掃描實驗發現,活躍集在訓練的前1500萬到3000萬步中就已經鎖定,而獎勵變為正值則要晚3500萬到10500萬步。這意味著智慧體先確定了使用哪些神經元,然後才學會如何利用它們。
此外,在Breakout遊戲中,研究者發現了一個互補現象:使用凍結CNN的智慧體與可訓練CNN的智慧體達到了相當的獎勵水平,但透過結構不同的資訊瓶頸實現。凍結CNN使用17-25個活躍神經元(參與比率約10-14),而可訓練CNN使用51個(參與比率約3.6)。這表明隨機投影可以引導智慧體找到一種更緊湊的表徵方式。
總的來說,這項研究揭示了當輸入維度遠大於任務內在維度時,梯度下降作用於一個凍結的隨機投影可以揭示問題的有效秩,而無需顯式的稀疏性機制。這一發現不僅深化了對深度強化學習內部工作機制的理解,還可能啟發新的演算法設計,例如透過有意引入隨機性來強制稀疏表徵,從而提高計算效率和泛化能力。