AI News HubLIVE
サイト内リライト2 分で読了

推論が手を狭める:LLMゲームプレイにおける多様性の崩壊

研究により、教師ありファインチューニング(SFT)が大規模言語モデルを下流タスクに適応させる際、特に逐次的意思決定において行動の多様性を著しく低下させることが明らかになった。三目並べの変種などの確定論的ボードゲームを用いた制御実験を通じて、著者らは推論モードの生成がしばしば行動の多様性を抑制し、標準的なSFTは精度向上に必要以上に早期の多様性崩壊を引き起こすことを示した。行動拡張(各状態におけるすべての最適行動を訓練する)はこの効果を部分的に緩和する。

ソースarXiv Computational Linguistics著者: Junyi Sha, Renfei Tan, David Simchi-Levi

arXivに投稿された新しい研究は、教師ありファインチューニング(SFT)が大規模言語モデル(LLM)を下流タスクに適応させる際の予期せぬ副作用、すなわち行動の多様性の崩壊を明らかにした。この研究はJunyi Shaらによるもので、論文タイトルは「When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play」であり、2026年7月21日にarXivに提出された。

研究者らは、三目並べの変種からなる確定論的ボードゲームのスイートを使用した。これらのゲームでは最適な行動が正確に計算可能であり、多様性を直接測定できる。状態レベルの評価、アリーナ対戦、訓練軌跡の分析を通じて、2つの主要な現象が発見された。第一に、モデルが推論モードで行動を生成する際、行動の多様性がしばしば抑制され、その抑制が常に行動の正確性の向上を伴うわけではない。つまり、推論は特定の状況で正しい決定を助けるかもしれないが、他の同等に有効な行動を探索する能力を制限する。第二に、標準的なSFTは正確性を向上させるものの、正確性と多様性のトレードオフが必要とする以上に早期の多様性崩壊を引き起こすことが多い。この崩壊は訓練の初期段階でも観察され、モデルが少数の行動に早期に収束する原因となる。

この多様性崩壊は「狭いサポートの模倣」(narrow-support imitation)に起因するとされ、モデルが単一の実証行動のみを模倣する学習を行い、同じ状態で有効な他の行動を無視することによる。この問題に対処するため、著者らは行動拡張(action augmentation)戦略を提案した。各状態において、モデルは一つの実証行動だけでなく、すべての最適行動を学習する。実験の結果、この方法が多様性崩壊を部分的に緩和することが示されたが、完全に排除するには至らなかった。

この研究の結論は、探索的な行動を必要とする意思決定タスクにおけるLLMの応用に重要な示唆を与える。著者らは、SFT中に行動サポート(すなわち複数の実行可能な行動)を維持することが、探索行動を維持するために重要であると示唆している。本研究は、逐次的意思決定におけるLLMの行動劣化を理解する新たな視点を提供し、微調整戦略の改善方向を示している。例えば、行動拡張の導入や、よりバランスの取れたデータセットの設計が考えられる。今後の研究では、より複雑なタスクでこれらの発見を検証し、多様性を維持する新しい方法を開発することが期待される。