在人工智能快速發展的當下,大型語言模型(LLM)越來越多地參與高影響決策,例如醫療診斷、金融分析等領域。為了確保模型行為可被理解和審計,模型給出的解釋變得至關重要。然而,這些解釋常常並不忠實於模型真實的推理過程,這種現象被稱為“不忠實解釋”。針對如何提升LLM解釋的忠實度,一項新的研究提出了一種基於移除的測試時方法。
該研究由Qinglan Luo、S M A Nahian、John Guttag、S. Mazdak Abulnaga和Katie Matton合作完成,論文於2026年9月3日提交至arXiv預印本平台,編號為2609.04343,分類為人工智能(cs.AI)與計算語言學(cs.CL)。論文的DOI為10.48550/arXiv.2609.04343。
研究者首先明確了不忠實解釋的兩個獨立維度:不完整性與不健全性。不完整性是指解釋遺漏了那些實際影響模型答案的因素;不健全性則是指解釋提及了並未對模型答案產生影響的因素。現有方法中,訓練時方法通常需要訪問模型內部權重並消耗大量計算資源,而測試時方法大多針對的是不健全性。然而,不完整性問題同樣嚴峻且尚未得到充分關注。
為此,研究者提出了一種直接針對不完整性的測試時方法。該方法的核心思想是:將模型解釋中未認可的概念從原始輸入中移除,僅保留解釋中提及的概念,再讓模型基於這一精簡後的輸入重新進行推理。通過這種“移除”操作,模型決策過程中那些未被解釋提及的隱藏影響被消除,同時已提及概念的影響得以保留,從而提升瞭解釋的忠實度。
研究團隊在兩個數據集上、多個不同模型家族以及兩個獨立的忠實度指標上進行了實驗。結果顯示,與標準提示方法以及明確鼓勵忠實性的提示方法相比,該方法均能有效提高解釋的忠實度。該方法具備模型無關性,可以在推理階段直接應用,無需修改任何模型參數。這一特性使得它能夠靈活地嵌入現有系統,用於減少隱藏因素的影響,提升基於LLM的決策支持系統的可靠性與安全性。
論文的完整文本可通過arXiv獲取,用户可訪問PDF、實驗性HTML或TeX源代碼等不同版本。該研究的提交歷史顯示,第一版(v1)於2026年9月3日18:09:26 UTC提交,文件大小約1,881 KB。論文的通訊作者之一為S. Mazdak Abulnaga。這項研究為LLM可解釋性領域提供了新的工具,並有望在需要高可靠性的AI輔助決策場景中發揮重要作用。