AI News HubLIVE
站內改寫1 分鐘閱讀

當推理縮小動作空間:LLM遊戲中的多樣性崩潰

研究發現,監督微調(SFT)在將大語言模型適配到下游任務時,會顯著降低其行為多樣性,尤其是在順序決策任務中。通過在井字棋變體等確定性棋盤遊戲上的實驗,作者指出推理模式生成常常抑制動作多樣性,而標準SFT雖然提高準確率,卻導致過早的多樣性崩潰。動作增強(即訓練所有最優動作而非單一動作)可部分緩解這一問題。

來源arXiv Computational Linguistics作者: Junyi Sha, Renfei Tan, David Simchi-Levi

一篇來自arXiv的新研究揭示了監督微調(SFT)在適配大語言模型(LLM)到下游任務時的一個意外副作用:行為多樣性的崩潰。該研究由Junyi Sha等人完成,論文題為“When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play”,於2026年7月21日提交至arXiv。

研究人員使用一套基於井字棋變體的確定性棋盤遊戲套件,在這些遊戲中最優動作可精確計算,多樣性可直接測量。通過狀態級評估、競技場對戰以及訓練軌跡分析,他們發現了兩個主要現象。首先,當模型在推理模式下生成動作時,動作多樣性經常受到抑制,且這種抑制並非總是伴隨着動作準確率的提升。這意味着,儘管推理可能幫助模型在某些情況下做出正確決策,但它也限制了模型探索其他可能同樣有效的動作。其次,標準的SFT雖然提高了準確率,但往往導致過早的多樣性崩潰,其程度超過了準確率-多樣性權衡所需的最小值。這種崩潰被監測到甚至發生在訓練早期,使得模型過早收斂到少數幾個動作。

這種多樣性崩潰被歸因於“窄支持模仿”(narrow-support imitation),即模型僅學習模仿單個示範動作,而忽略了在同一狀態下同樣有效的其他動作。為了應對這一問題,作者提出了動作增強(action augmentation)策略:在訓練過程中,對於每個狀態,模型不僅學習一個示範動作,而是學習所有最優動作。實驗結果表明,這種方法可以部分緩解多樣性崩潰,儘管不能完全消除。

研究的結論對LLM在需要探索性行為的決策任務中的應用具有重要意義。作者建議,在SFT過程中保留動作支持(即多種可行動作)對於維持模型的探索行為至關重要。這項研究為理解LLM在順序決策中的行為退化提供了新的視角,並指出了改進微調策略的方向,例如引入動作增強或設計更平衡的數據集。未來的工作可以探索在更復雜的任務中驗證這些發現,並開發新的方法以保持模型的多樣性。