AI News HubLIVE
站内改写2 分钟阅读

深度强化学习中冻结随机CNN特征提取器的自发稀疏性

研究人员发现,使用冻结随机CNN特征提取器的深度强化学习智能体,在没有任何稀疏性诱导目标的情况下,会自发地在全连接层中产生极度稀疏的表征。在确定性的Pong游戏中,64个神经元中仅1-3个被激活,而可训练的CNN在相同条件下激活55-64个。稀疏性程度随任务复杂度变化,且随机种子会导致不同的稀疏模式。移除这些活跃神经元会导致性能崩溃,而活跃集在训练早期就已锁定。该现象揭示了输入维度远大于任务固有维度时,梯度下降在冻结随机投影上可以揭示问题的有效秩,无需显式的稀疏性机制。

来源arXiv Machine Learning作者: Scott M. Norton

一项新研究发现,在深度强化学习(DRL)中,使用冻结的、随机初始化的卷积神经网络(CNN)特征提取器的智能体,会自发地发展出极度稀疏的全连接层表征,而无需任何显式的稀疏性诱导目标。这一发现挑战了传统认知,即随机特征提取器只能产生杂乱无章的表征,而可训练的特征提取器才能学习到有效的结构。

实验表明,在经典的Atari游戏环境中,当使用冻结的随机CNN时,智能体的第一个全连接层(FC1,从3136维映射到64维)中,仅有极少数神经元被激活。例如,在确定性的Pong游戏中,64个神经元中只有1-3个被用于压缩任务相关信息,而在随机版本的Pong中,这一数字为5-11个。相比之下,如果CNN特征提取器是可训练的,则在相同条件下会有55-64个神经元被激活。

研究者总结了四个主要发现。首先,FC1层的稀疏程度与任务复杂度密切相关:Pong游戏有1-11个活跃神经元,Breakout有19-26个,而Space Invaders约有42个。通过改变网络宽度,他们确认这种稀疏性反映了任务结构,而非固定的容量比例。其次,同一游戏内也存在尺度变化:三次使用不同随机种子的Pong实验分别产生了5、7和11个活跃神经元。有趣的是,仅有5个活跃神经元的种子在训练中奖励停留在+14,而其他两种种子达到了专家级别的+18.4和+18.7,这表明随机投影的可用维度限制了可达性能的上限。

第三,通过消融实验,研究者确认了这些活跃神经元的必要性。在两种不同的PPO实现和四个游戏中,移除这些活跃神经元都会导致性能完全崩溃,说明它们承载了任务的关键信息。第四,信息瓶颈的形成时间很早:通过扫描实验发现,活跃集在训练的前1500万到3000万步中就已经锁定,而奖励变为正值则要晚3500万到10500万步。这意味着智能体先确定了使用哪些神经元,然后才学会如何利用它们。

此外,在Breakout游戏中,研究者发现了一个互补现象:使用冻结CNN的智能体与可训练CNN的智能体达到了相当的奖励水平,但通过结构不同的信息瓶颈实现。冻结CNN使用17-25个活跃神经元(参与比率约10-14),而可训练CNN使用51个(参与比率约3.6)。这表明随机投影可以引导智能体找到一种更紧凑的表征方式。

总的来说,这项研究揭示了当输入维度远大于任务内在维度时,梯度下降作用于一个冻结的随机投影可以揭示问题的有效秩,而无需显式的稀疏性机制。这一发现不仅深化了对深度强化学习内部工作机制的理解,还可能启发新的算法设计,例如通过有意引入随机性来强制稀疏表征,从而提高计算效率和泛化能力。