AI News HubLIVE
站內改寫2 分鐘閱讀

MoE中存在知識注入嗎?探索基於專家感知的對比解碼以減輕LLM幻覺

現有的大語言模型(LLM)幻覺緩解方法難以改變模型內部知識或泛化能力差。對比解碼利用層間差異減輕幻覺,但之前僅研究Transformer模型。本研究針對混合專家(MoE)模型,發現共享專家MoE中不存在層間差異,但高層專家在事實與幻覺輸出中啟用模式不同。據此提出EAACD方法,透過專家感知自適應對比解碼,將高層專家分為高可靠組和低可靠組,對比預測並放大低可靠組的幻覺作為負參考,有效減輕QA任務幻覺,在四個資料集上超越基線方法。

來源arXiv Computational Linguistics作者: Xinyue Fang, Zhiliang Tian, Zhen Huang, Ziyi Pan, Zhihua Wen, Xi Wang, Quntian Fang, Dongsheng Li

近日,一項來自arXiv的研究(論文ID: 2607.20426)深入探討了混合專家(Mixture-of-Experts, MoE)模型中的幻覺緩解問題。該研究由Xinyue Fang等八位作者共同完成,已被ACL2會議接收,提交日期為2026年5月8日。

現有的大語言模型(LLM)幻覺緩解方法主要分為提示工程和模型最佳化兩類。提示工程透過精心設計的提示詞引導模型生成更準確的輸出,但難以改變模型內部固有的錯誤知識。模型最佳化則透過微調或對抗訓練等方式調整模型引數,但往往缺乏跨領域的泛化能力,在未見過的任務上效果不佳。對比解碼(Contrastive Decoding)方法則另闢蹊徑,透過利用LLM不同層之間的輸出差異來抑制幻覺,在Transformer架構(如GPT)中取得了顯著效果。然而,之前的研究主要集中在Transformer模型上,忽略了混合專家(MoE)等其他高效架構。MoE模型透過引入多個專家網路和門控機制,改變了傳統Transformer的層結構,因此層間差異的特性可能有所不同。

研究團隊首先透過一系列實證實驗探索MoE模型中是否存在類似Transformer的層間差異。他們發現,在採用共享專家的MoE架構中,並沒有觀察到與Transformer相似的層間差異現象。然而,進一步分析揭示,在不同MoE架構中,高層網路中的不同專家在事實性輸出和非事實性輸出(即幻覺)之間表現出截然不同的啟用模式。這一發現表明,雖然層間差異消失了,但專家層面的啟用差異可以作為新的訊號來識別和減輕幻覺。

基於這一重要發現,研究團隊提出了專家感知自適應對比解碼(Expert-Aware Adaptive Contrast Decoding, EAACD)方法。EAACD的核心思想是充分利用MoE高層專家之間的差異。具體而言,該方法首先根據每個專家的置信度和預測一致性,將高層專家劃分為一個高可靠組和多個低可靠組。然後,透過對比高可靠組與各個低可靠組的預測結果,對模型原始的預測進行校準。為了進一步增強對比訊號的強度,EAACD還透過注意力機制和掩碼操作,有選擇地放大低可靠組專家產生的幻覺輸出,從而提供更強的負面參考訊號。這種方法使得模型能夠更清晰地識別並避免產生幻覺。

實驗部分,研究團隊在四個問答(QA)資料集上對EAACD進行了評估,包括事實性知識問答和領域特定問答等任務。結果表明,EAACD在所有資料集上均全面超越了現有的多種基線方法,包括傳統的對比解碼方法以及其他專門的幻覺緩解技術。這不僅驗證了EAACD的有效性,也為MoE架構下的幻覺緩解研究提供了全新的思路。該研究的重要意義在於,它首次系統地探索了MoE模型中專家層面的差異用於幻覺檢測和緩解的可行性,並提出了一個實用的解決方案。未來,這一方法有望被整合到基於MoE的大型語言模型中,提升其在實際應用中的可靠性和準確性。