当推理缩小动作空间:LLM游戏中的多样性崩溃
研究发现,监督微调(SFT)在将大语言模型适配到下游任务时,会显著降低其行为多样性,尤其是在顺序决策任务中。通过在井字棋变体等确定性棋盘游戏上的实验,作者指出推理模式生成常常抑制动作多样性,而标准SFT虽然提高准确率,却导致过早的多样性崩溃。动作增强(即训练所有最优动作而非单一动作)可部分缓解这一问题。
一篇来自arXiv的新研究揭示了监督微调(SFT)在适配大语言模型(LLM)到下游任务时的一个意外副作用:行为多样性的崩溃。该研究由Junyi Sha等人完成,论文题为“When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play”,于2026年7月21日提交至arXiv。
研究人员使用一套基于井字棋变体的确定性棋盘游戏套件,在这些游戏中最优动作可精确计算,多样性可直接测量。通过状态级评估、竞技场对战以及训练轨迹分析,他们发现了两个主要现象。首先,当模型在推理模式下生成动作时,动作多样性经常受到抑制,且这种抑制并非总是伴随着动作准确率的提升。这意味着,尽管推理可能帮助模型在某些情况下做出正确决策,但它也限制了模型探索其他可能同样有效的动作。其次,标准的SFT虽然提高了准确率,但往往导致过早的多样性崩溃,其程度超过了准确率-多样性权衡所需的最小值。这种崩溃被监测到甚至发生在训练早期,使得模型过早收敛到少数几个动作。
这种多样性崩溃被归因于“窄支持模仿”(narrow-support imitation),即模型仅学习模仿单个示范动作,而忽略了在同一状态下同样有效的其他动作。为了应对这一问题,作者提出了动作增强(action augmentation)策略:在训练过程中,对于每个状态,模型不仅学习一个示范动作,而是学习所有最优动作。实验结果表明,这种方法可以部分缓解多样性崩溃,尽管不能完全消除。
研究的结论对LLM在需要探索性行为的决策任务中的应用具有重要意义。作者建议,在SFT过程中保留动作支持(即多种可行动作)对于维持模型的探索行为至关重要。这项研究为理解LLM在顺序决策中的行为退化提供了新的视角,并指出了改进微调策略的方向,例如引入动作增强或设计更平衡的数据集。未来的工作可以探索在更复杂的任务中验证这些发现,并开发新的方法以保持模型的多样性。