不確実性を考慮したマルチLLMシステムの信頼推定:構造化専門家判断に基づくアプローチ
本論文では、マルチLLMシステムの予測集約における新たな不確実性認識型信頼推定手法を提案。決定論の構造化専門家判断を適応し、Cooke対数重み付けにより各LLMの信頼性をキャリブレーション。MMLUとMMLU-Proでの評価により、不均一・汚染環境で従来手法を上回る性能を示した。
大規模言語モデル(LLM)のアンサンブルシステムは、複数のLLMの予測を組み合わせることで信頼性を向上させる手法として、自然言語処理の様々なタスクで広く採用されています。しかし、従来の集約手法(平均化や多数決など)は、すべてのモデルが同等に信頼できると暗に仮定しており、各モデルが持つ不確実性の質の違いを無視しています。この仮定は、モデルごとに信頼性や能力が大きく異なる異種LLM環境では特に問題となります。悪意のあるまたは信頼性の低い専門家が混在する場合、単純な集約は全体の性能を著しく低下させる可能性があります。本研究では、Jiawei Zheng氏とJiazhen Zhang氏の研究チームが、マルチLLM集約を「不確実性を考慮した信頼推定」の問題として新たに定式化しました。彼らは意思決定理論における構造化専門家判断(SEJ)を応用し、文脈に応じたキャリブレーション質問を用いて各LLMの確率予測の質を評価し、その信頼性を推定します。特に、Cookeスタイルの対数重み付けを採用することで、過信した誤った予測にペナルティを与え、適切にキャリブレーションされた専門家を優先するように重みを調整します。実験では、MMLUおよびMMLU-Proデータセットを用いて、同質(同じアーキテクチャのモデル)、異質(異なるアーキテクチャのモデル)、および汚染(意図的に誤った回答を生成するモデルを含む)の3種類の専門家パネルで評価を実施しました。結果は、同質設定ではどの集約手法も同程度の性能を示す一方、異質性や汚染が存在する場合にはCooke重み付けが重要な役割を果たし、精度と信頼性のバランスにおいて優れた結果を達成しました。また、信頼できない専門家が追加されてもロバスト性を維持することが確認されました。これらの知見は、マルチLLM集約においては予測の単純な組み合わせだけでなく、不確実性下での信頼のキャリブレーションが不可欠であることを示しています。本論文は2026年7月10日にarXivに投稿され(ID: 2607.20529)、機械学習(cs.LG)と人工知能(cs.AI)の分野に分類されています。この研究は、医療診断や法律分析など高い信頼性が求められるアプリケーションにおいて、より堅牢なマルチモデルシステムを構築するための重要な基盤を提供するものと期待されます。