MoE中存在知识注入吗?探索基于专家感知的对比解码以减轻LLM幻觉
现有的大语言模型(LLM)幻觉缓解方法难以改变模型内部知识或泛化能力差。对比解码利用层间差异减轻幻觉,但之前仅研究Transformer模型。本研究针对混合专家(MoE)模型,发现共享专家MoE中不存在层间差异,但高层专家在事实与幻觉输出中激活模式不同。据此提出EAACD方法,通过专家感知自适应对比解码,将高层专家分为高可靠组和低可靠组,对比预测并放大低可靠组的幻觉作为负参考,有效减轻QA任务幻觉,在四个数据集上超越基线方法。
近日,一项来自arXiv的研究(论文ID: 2607.20426)深入探讨了混合专家(Mixture-of-Experts, MoE)模型中的幻觉缓解问题。该研究由Xinyue Fang等八位作者共同完成,已被ACL2会议接收,提交日期为2026年5月8日。
现有的大语言模型(LLM)幻觉缓解方法主要分为提示工程和模型优化两类。提示工程通过精心设计的提示词引导模型生成更准确的输出,但难以改变模型内部固有的错误知识。模型优化则通过微调或对抗训练等方式调整模型参数,但往往缺乏跨领域的泛化能力,在未见过的任务上效果不佳。对比解码(Contrastive Decoding)方法则另辟蹊径,通过利用LLM不同层之间的输出差异来抑制幻觉,在Transformer架构(如GPT)中取得了显著效果。然而,之前的研究主要集中在Transformer模型上,忽略了混合专家(MoE)等其他高效架构。MoE模型通过引入多个专家网络和门控机制,改变了传统Transformer的层结构,因此层间差异的特性可能有所不同。
研究团队首先通过一系列实证实验探索MoE模型中是否存在类似Transformer的层间差异。他们发现,在采用共享专家的MoE架构中,并没有观察到与Transformer相似的层间差异现象。然而,进一步分析揭示,在不同MoE架构中,高层网络中的不同专家在事实性输出和非事实性输出(即幻觉)之间表现出截然不同的激活模式。这一发现表明,虽然层间差异消失了,但专家层面的激活差异可以作为新的信号来识别和减轻幻觉。
基于这一重要发现,研究团队提出了专家感知自适应对比解码(Expert-Aware Adaptive Contrast Decoding, EAACD)方法。EAACD的核心思想是充分利用MoE高层专家之间的差异。具体而言,该方法首先根据每个专家的置信度和预测一致性,将高层专家划分为一个高可靠组和多个低可靠组。然后,通过对比高可靠组与各个低可靠组的预测结果,对模型原始的预测进行校准。为了进一步增强对比信号的强度,EAACD还通过注意力机制和掩码操作,有选择地放大低可靠组专家产生的幻觉输出,从而提供更强的负面参考信号。这种方法使得模型能够更清晰地识别并避免产生幻觉。
实验部分,研究团队在四个问答(QA)数据集上对EAACD进行了评估,包括事实性知识问答和领域特定问答等任务。结果表明,EAACD在所有数据集上均全面超越了现有的多种基线方法,包括传统的对比解码方法以及其他专门的幻觉缓解技术。这不仅验证了EAACD的有效性,也为MoE架构下的幻觉缓解研究提供了全新的思路。该研究的重要意义在于,它首次系统地探索了MoE模型中专家层面的差异用于幻觉检测和缓解的可行性,并提出了一个实用的解决方案。未来,这一方法有望被集成到基于MoE的大型语言模型中,提升其在实际应用中的可靠性和准确性。