大規模言語モデル(LLM)は、医療診断や金融分析などの影響度の高い意思決定にますます利用されるようになっており、モデルの説明は行動を監査するための重要なツールとなっている。しかし、これらの説明は、モデルの決定の背後にある実際の推論を反映しておらず、不誠実である可能性がある。本研究では、LLMが質問に応じて回答と説明の両方を提供する設定を考える。研究者らは、不誠実な説明には「不完全性」と「不健全性」という2つの異なる次元があることを特定した。不完全性とは、説明が回答に影響を与える要因を省略していることを意味し、不健全性とは、説明がモデルの回答に影響を与えなかった要因を引用していることを意味する。既存のLLMの忠実性を向上させるアプローチには、モデル重みへのアクセスと大規模な計算リソースを必要とするトレーニング時手法と、主に不健全性への対処に焦点を当てたテスト時手法がある。本研究では、不完全性に直接対処するテスト時アプローチを導入する。
このアプローチでは、モデルの説明で認められていない概念を入力から除去し、その縮小された入力に対してモデルを再クエリする。これにより、言及されていない影響を排除しつつ、言及された概念の影響を保持する。2つのデータセット、複数のモデルファミリー、2つの独立した忠実性指標にわたって、標準的なプロンプトや忠実性を促進するプロンプトと比較して、説明の忠実性が向上することが実証された。この手法はモデルに依存せず、推論時にモデルパラメータを変更せずに適用できる。これにより、隠れた影響を低減し、LLM支援による意思決定の信頼性と安全性を向上させる柔軟なメカニズムが提供される。
本論文は、Qinglan Luo、S M A Nahian、John Guttag、S. Mazdak Abulnaga、Katie Mattonによって執筆され、2026年9月3日にarXivに提出された。識別番号は2609.04343で、人工知能(cs.AI)と計算言語学(cs.CL)に分類される。DOIは10.48550/arXiv.2609.04343である。論文の完全なテキストはarXivから入手でき、PDF、実験的なHTML、TeXソースなどの形式でアクセスできる。提出履歴によると、v1は2026年9月3日18:09:26 UTCに提出され、ファイルサイズは約1,881 KBである。
本研究の核心的な貢献は、説明の不完全性に焦点を当てた新しいテスト時手法を提案したことにある。従来の手法の多くは不健全性のみを扱っていたが、この手法は入力から説明で言及されていない概念を削除することで、モデルが暗黙的に依存している可能性のある要因を排除し、説明の正確性を高める。実験結果は、この手法が様々な状況で有効であることを示しており、LLMの解釈可能性と安全性の向上に寄与することが期待される。さらに、モデル非依存であるため、既存のLLMシステムへの統合が容易であり、実用的な価値が高い。