AI News HubLIVE
サイト内リライト2 分で読了

確率的サンプリングは認識論的に浅い:LLMにおける温度変化とモデルの多様性の間の次元格差

研究により、温度サンプリングによる単一LLMの繰り返し実行による回答の変動(自己一貫性)は、せいぜい1次元の構造しか明らかにしないのに対し、複数の異なるモデルのアンサンブルはより多くの質問間の信号を検出し、モデルが何を知らないかをよりよく明らかにすることが示された。

ソースarXiv AI著者: Izhar Ali

新しい研究論文「確率的サンプリングは認識論的に浅い:LLMにおける温度変化とモデルの多様性の間の次元格差」は、大規模言語モデル(LLM)における不確実性推定の方法を探求している。この研究はIzhar Aliらによって行われ、EIML@ICML 2026に受理された。研究の核心的な問いは、言語モデルが繰り返し実行で異なる回答を出すとき、その変動がモデルの知らないことを明らかにするかどうかである。自己一貫性は多数決によって各質問の不確実性推定に変えるが、同じ変動が質問間の構造——関連質問が一緒に変動するパターン——を明らかにできるかは不明である。

研究では、同じ質問セットに対して、単一のLLMを温度τ=1で100回実行する場合と、24個の異なるLLMをτ=0でそれぞれ1回実行するアンサンブルを比較している。Marchenko-Pasturランダム行列テストを用いて、両側の信号とサンプリングノイズを分離した。結果は、5つのモデルファミリーと3つのベンチマーク(MMLU、HellaSwag、GSM8K)において、単一モデルでは最大でも1つの次元しかノイズを超えないことを示した。一方、アンサンブルではノイズ閾値を超える4つの固有値が現れ、比較対象の難易度を一致させたベルヌーイ帰無仮説では500回のモンテカルロシミュレーションで最大1つしか現れなかった。

これは、自己一貫性(多数決による)が個々の質問の信頼度を正確に推定できる一方で、質問間の構造的相関を明らかにできないことを示している。多様なモデルのアンサンブルによってのみ、モデルが何を知らないかをより包括的に明らかにできる。この研究は、不確実性定量化におけるアンサンブル手法の価値を強調し、多様性の源としての温度サンプリングの限界を指摘している。この発見は、モデル選定、推論コスト、プロダクト能力、評価基準に影響を与え、実務者がモデルの知識境界を深く理解する必要がある場合、繰り返しサンプリングよりもモデルの多様性を優先すべきであることを示唆している。