主張:LLMにおける不確実性定量化は教師なしクラスタリングに過ぎない
本論文は、大規模言語モデル(LLM)の不確実性定量化(UQ)手法がカテゴリエラーを犯しており、実質的には教師なしクラスタリングアルゴリズムであると主張する。これらの手法は内部一貫性のみを測定し、事実の正しさを評価しないため、「自信過剰な幻覚」を検出できない。著者らは、ハイパーパラメータ感度、安定性と真実を混同する内部評価サイクル、グラウンドトゥルースの欠如という3つの重大な病態を特定し、客観的真実に基づくUQへのパラダイムシフトを提唱している。
ICML 2026に採択された立場論文が、大規模言語モデル(LLM)における不確実性定量化(UQ)の現状に鋭い批判を投げかけている。著者らは、主流のUQ手法はカテゴリエラーを犯しており、実質的には教師なしクラスタリングアルゴリズムであると主張する。これらの手法が測定するのはモデル生成の内部一貫性であり、外部の事実との一致度ではない。その結果、既存手法は「自信過剰な幻覚」、すなわちモデルが安定しているが誤った答えに高い確信を示す現象を全く検出できない。医療や法律などの高リスク領域では、この欠陥が展開者に偽りの安全感を与え、深刻な結果を招く恐れがある。
論文は具体的に三つの重大な病態を挙げている。第一に、ハイパーパラメータ感度の危機:UQの性能は調整が難しい閾値や設定に極度に依存し、安全な展開を妨げる。第二に、内部評価サイクル:既存の評価指標は安定性と真実性を混同し、モデルが正確性を犠牲にして一貫性を追求する原因となる。第三に、グラウンドトゥルースの欠如:正解が得られないため、研究者は不安定な代理指標に頼らざるを得ず、問題を悪化させる。
この行き詰まりを打開するため、著者らは三つの変革を提案する。第一に、外部知識ベースによる検証など、より厳格な評価指標と実験設定の採用。第二に、サンプリングによる推定ではなく、モデル自体が内在的な不確実性推定を出力するメカニズムの導入。第三に、客観的真実を校正のアンカーとし、モデルの信頼度が現実の信頼性の代理として機能することを保証する。著者らは、内部循環から脱却して初めてUQが真の安全策として機能すると強調する。
本論文はICML 2026の立場論文として採択され、現在arXivで公開されている。著者はTiejin Chenら4名で、論文IDはarXiv:2605.19220。関連コードとデータは近日中に公開され、今後の研究のベンチマークとなる予定である。