AI News HubLIVE
サイト内リライト2 分で読了

MoEにおける知識注入は存在するか?LLMの幻覚軽減のための専門家認識型コントラストデコーディングの探究

既存のLLM幻覚軽減手法は、モデルの内部知識を変更できないか、クロスドメイン汎化が不十分である。コントラスティブデコーディングは層ごとの差異を利用するが、これまではトランスフォーマーモデルでのみ研究されてきた。本研究では、混合専門家(MoE)モデルを調査し、共有専門家を持つMoEには層ごとの差異は存在しないが、高層の専門家は事実出力と非事実出力で異なる活性化パターンを示すことを発見。提案手法EAACDは、高層専門家を信頼性グループに分割し、予測を対比させ、低信頼性専門家の幻覚を増幅して負の参照とすることで、4つのQAデータセットでベースラインを上回る性能を達成した。

ソースarXiv Computational Linguistics著者: Xinyue Fang, Zhiliang Tian, Zhen Huang, Ziyi Pan, Zhihua Wen, Xi Wang, Quntian Fang, Dongsheng Li

最近、arXivに投稿された研究(論文ID: 2607.20426)では、混合専門家(Mixture-of-Experts, MoE)モデルにおける幻覚軽減の新しい手法が探求されました。Xinyue Fang氏を含む8名の著者によるこの研究は、ACL2会議に採択されており、2026年5月8日に提出されました。

既存の大規模言語モデル(LLM)の幻覚軽減手法は、主にプロンプトエンジニアリングとモデル最適化に分類されます。プロンプトエンジニアリングは、入力を工夫することでモデルの出力を改善しようとしますが、モデル内部の誤った知識を修正することは困難です。一方、モデル最適化は微調整や敵対的訓練などを通じてモデルパラメータを調整しますが、ドメイン間の汎化性能が低いという課題があります。コントラスティブデコーディング(Contrastive Decoding)は、LLMの異なる層間の出力差を利用して幻覚を抑制する手法であり、Transformerアーキテクチャ(GPTなど)で顕著な効果を示してきました。しかし、これまでの研究は主にTransformerモデルに焦点を当てており、混合専門家(MoE)のような他の効率的なフレームワークは無視されていました。MoEモデルは複数の専門家ネットワークとゲーティング機構を導入することで従来のTransformer構造を変更しており、層間差異の特性が異なる可能性があります。

研究チームはまず、MoEモデルにTransformerと同様の層間差異が存在するかを実証的に調査しました。その結果、共有専門家を採用するMoEアーキテクチャでは、Transformerのような層間差異は観察されないことがわかりました。しかし、さらなる分析により、異なるMoEアーキテクチャにおいて、高層の各専門家は事実に基づく出力と幻覚出力で明確に異なる活性化パターンを示すことが明らかになりました。この発見は、層間差異が消失する代わりに、専門家レベルの活性化パターンが幻覚検出の新たなシグナルとして利用できることを示唆しています。

この重要な発見に基づき、研究チームは専門家認識型適応コントラストデコーディング(Expert-Aware Adaptive Contrast Decoding, EAACD)を提案しました。EAACDの核心は、MoEの高層専門家間の差異を最大限に活用することです。具体的には、各専門家の信頼度と予測の一貫性に基づいて、高層専門家を高信頼グループと複数の低信頼グループに分割します。そして、高信頼グループと各低信頼グループの予測を対比させることで、モデルの元の予測を較正します。この対比効果を強化するため、EAACDはアテンション機構とマスキングを用いて低信頼グループの専門家が生成する幻覚出力を選択的に増幅し、より強力な負の参照シグナルを提供します。これにより、モデルは幻覚を明確に識別し回避できるようになります。

実験では、事実知識に基づく質問応答やドメイン特化型のQAを含む4つのデータセットでEAACDを評価しました。結果は、EAACDが従来のコントラストデコーディングを含む既存のベースライン手法をすべてのデータセットで上回る性能を示しました。この研究は、MoEアーキテクチャにおける専門家レベルの差異を幻覚軽減に活用する先駆的な試みであり、実用的なソリューションを提供しています。将来的には、この手法がMoEベースの大規模言語モデルに統合され、実世界のアプリケーションでの信頼性と正確性を向上させることが期待されます。