跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

基于输入移除的测试时方法提升LLM解释忠实度

文章摘要

大语言模型的解释常常不够忠实。这篇论文提出一种测试时方法,针对解释不完整的问题:删除输入中未被解释提及的概念后重新查询模型。在多个数据集、模型家族和两个忠实性指标上,该方法都优于标准提示和鼓励忠实的提示,且不依赖模型参数,可灵活用于推理阶段。

来源arXiv AI作者: Qinglan Luo, S M A Nahian, John Guttag, S. Mazdak Abulnaga, Katie Matton
基于输入移除的测试时方法提升LLM解释忠实度
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

在人工智能快速发展的当下,大型语言模型(LLM)越来越多地参与高影响决策,例如医疗诊断、金融分析等领域。为了确保模型行为可被理解和审计,模型给出的解释变得至关重要。然而,这些解释常常并不忠实于模型真实的推理过程,这种现象被称为“不忠实解释”。针对如何提升LLM解释的忠实度,一项新的研究提出了一种基于移除的测试时方法。

该研究由Qinglan Luo、S M A Nahian、John Guttag、S. Mazdak Abulnaga和Katie Matton合作完成,论文于2026年9月3日提交至arXiv预印本平台,编号为2609.04343,分类为人工智能(cs.AI)与计算语言学(cs.CL)。论文的DOI为10.48550/arXiv.2609.04343。

研究者首先明确了不忠实解释的两个独立维度:不完整性与不健全性。不完整性是指解释遗漏了那些实际影响模型答案的因素;不健全性则是指解释提及了并未对模型答案产生影响的因素。现有方法中,训练时方法通常需要访问模型内部权重并消耗大量计算资源,而测试时方法大多针对的是不健全性。然而,不完整性问题同样严峻且尚未得到充分关注。

为此,研究者提出了一种直接针对不完整性的测试时方法。该方法的核心思想是:将模型解释中未认可的概念从原始输入中移除,仅保留解释中提及的概念,再让模型基于这一精简后的输入重新进行推理。通过这种“移除”操作,模型决策过程中那些未被解释提及的隐藏影响被消除,同时已提及概念的影响得以保留,从而提升了解释的忠实度。

研究团队在两个数据集上、多个不同模型家族以及两个独立的忠实度指标上进行了实验。结果显示,与标准提示方法以及明确鼓励忠实性的提示方法相比,该方法均能有效提高解释的忠实度。该方法具备模型无关性,可以在推理阶段直接应用,无需修改任何模型参数。这一特性使得它能够灵活地嵌入现有系统,用于减少隐藏因素的影响,提升基于LLM的决策支持系统的可靠性与安全性。

论文的完整文本可通过arXiv获取,用户可访问PDF、实验性HTML或TeX源代码等不同版本。该研究的提交历史显示,第一版(v1)于2026年9月3日18:09:26 UTC提交,文件大小约1,881 KB。论文的通讯作者之一为S. Mazdak Abulnaga。这项研究为LLM可解释性领域提供了新的工具,并有望在需要高可靠性的AI辅助决策场景中发挥重要作用。

展开要点与分析

文章情报

工程师进阶

要点

  • 不忠实解释可分为不完整性和不健全性两类
  • 现有测试时方法主要处理不健全性,本文聚焦不完整性
  • 通过删除未提及概念并重新查询来消除隐藏影响
  • 方法模型无关,推理时即可应用,无需修改参数

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。