跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

基於輸入移除的測試時方法提升LLM解釋忠實度

文章摘要

大語言模型的解釋常常不夠忠實。這篇論文提出一種測試時方法,針對解釋不完整的問題:刪除輸入中未被解釋提及的概念後重新查詢模型。在多個資料集、模型家族和兩個忠實性指標上,該方法都優於標準提示和鼓勵忠實的提示,且不依賴模型引數,可靈活用於推理階段。

來源arXiv AI作者: Qinglan Luo, S M A Nahian, John Guttag, S. Mazdak Abulnaga, Katie Matton
基於輸入移除的測試時方法提升LLM解釋忠實度
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在人工智慧快速發展的當下,大型語言模型(LLM)越來越多地參與高影響決策,例如醫療診斷、金融分析等領域。為了確保模型行為可被理解和審計,模型給出的解釋變得至關重要。然而,這些解釋常常並不忠實於模型真實的推理過程,這種現象被稱為“不忠實解釋”。針對如何提升LLM解釋的忠實度,一項新的研究提出了一種基於移除的測試時方法。

該研究由Qinglan Luo、S M A Nahian、John Guttag、S. Mazdak Abulnaga和Katie Matton合作完成,論文於2026年9月3日提交至arXiv預印本平臺,編號為2609.04343,分類為人工智慧(cs.AI)與計算語言學(cs.CL)。論文的DOI為10.48550/arXiv.2609.04343。

研究者首先明確了不忠實解釋的兩個獨立維度:不完整性與不健全性。不完整性是指解釋遺漏了那些實際影響模型答案的因素;不健全性則是指解釋提及了並未對模型答案產生影響的因素。現有方法中,訓練時方法通常需要訪問模型內部權重並消耗大量計算資源,而測試時方法大多針對的是不健全性。然而,不完整性問題同樣嚴峻且尚未得到充分關注。

為此,研究者提出了一種直接針對不完整性的測試時方法。該方法的核心思想是:將模型解釋中未認可的概念從原始輸入中移除,僅保留解釋中提及的概念,再讓模型基於這一精簡後的輸入重新進行推理。透過這種“移除”操作,模型決策過程中那些未被解釋提及的隱藏影響被消除,同時已提及概念的影響得以保留,從而提升瞭解釋的忠實度。

研究團隊在兩個資料集上、多個不同模型家族以及兩個獨立的忠實度指標上進行了實驗。結果顯示,與標準提示方法以及明確鼓勵忠實性的提示方法相比,該方法均能有效提高解釋的忠實度。該方法具備模型無關性,可以在推理階段直接應用,無需修改任何模型引數。這一特性使得它能夠靈活地嵌入現有系統,用於減少隱藏因素的影響,提升基於LLM的決策支援系統的可靠性與安全性。

論文的完整文本可透過arXiv獲取,使用者可訪問PDF、實驗性HTML或TeX原始碼等不同版本。該研究的提交歷史顯示,第一版(v1)於2026年9月3日18:09:26 UTC提交,檔案大小約1,881 KB。論文的通訊作者之一為S. Mazdak Abulnaga。這項研究為LLM可解釋性領域提供了新的工具,並有望在需要高可靠性的AI輔助決策場景中發揮重要作用。

展開要點與分析

文章情報

工程師進階

要點

  • 不忠實解釋可分為不完整性和不健全性兩類
  • 現有測試時方法主要處理不健全性,本文聚焦不完整性
  • 透過刪除未提及概念並重新查詢來消除隱藏影響
  • 方法模型無關,推理時即可應用,無需修改引數

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。