在人工智能快速发展的当下,大型语言模型(LLM)越来越多地参与高影响决策,例如医疗诊断、金融分析等领域。为了确保模型行为可被理解和审计,模型给出的解释变得至关重要。然而,这些解释常常并不忠实于模型真实的推理过程,这种现象被称为“不忠实解释”。针对如何提升LLM解释的忠实度,一项新的研究提出了一种基于移除的测试时方法。
该研究由Qinglan Luo、S M A Nahian、John Guttag、S. Mazdak Abulnaga和Katie Matton合作完成,论文于2026年9月3日提交至arXiv预印本平台,编号为2609.04343,分类为人工智能(cs.AI)与计算语言学(cs.CL)。论文的DOI为10.48550/arXiv.2609.04343。
研究者首先明确了不忠实解释的两个独立维度:不完整性与不健全性。不完整性是指解释遗漏了那些实际影响模型答案的因素;不健全性则是指解释提及了并未对模型答案产生影响的因素。现有方法中,训练时方法通常需要访问模型内部权重并消耗大量计算资源,而测试时方法大多针对的是不健全性。然而,不完整性问题同样严峻且尚未得到充分关注。
为此,研究者提出了一种直接针对不完整性的测试时方法。该方法的核心思想是:将模型解释中未认可的概念从原始输入中移除,仅保留解释中提及的概念,再让模型基于这一精简后的输入重新进行推理。通过这种“移除”操作,模型决策过程中那些未被解释提及的隐藏影响被消除,同时已提及概念的影响得以保留,从而提升了解释的忠实度。
研究团队在两个数据集上、多个不同模型家族以及两个独立的忠实度指标上进行了实验。结果显示,与标准提示方法以及明确鼓励忠实性的提示方法相比,该方法均能有效提高解释的忠实度。该方法具备模型无关性,可以在推理阶段直接应用,无需修改任何模型参数。这一特性使得它能够灵活地嵌入现有系统,用于减少隐藏因素的影响,提升基于LLM的决策支持系统的可靠性与安全性。
论文的完整文本可通过arXiv获取,用户可访问PDF、实验性HTML或TeX源代码等不同版本。该研究的提交历史显示,第一版(v1)于2026年9月3日18:09:26 UTC提交,文件大小约1,881 KB。论文的通讯作者之一为S. Mazdak Abulnaga。这项研究为LLM可解释性领域提供了新的工具,并有望在需要高可靠性的AI辅助决策场景中发挥重要作用。