跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

大語言模型中的證據整合

文章摘要

這項研究提出,LLM並非被動接受外部證據,而是基於自身先驗分佈對候選答案進行選擇性整合。實驗橫跨1000萬次測試、12個LLM和8個領域,發現證據與模型已有傾向越一致越容易被採納;相同證據可能使弱模型變好而讓強模型變差,甚至可能在模型內部已判定證據無效時仍被整合。

來源arXiv Computational Linguistics作者: Sebastien Kawada, Manolis Kellis
大語言模型中的證據整合
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

2026年9月3日提交至arXiv的一篇論文提出了一個系統性框架,用於理解大語言模型如何利用外部證據。論文由Sebastien Kawada和Manolis Kellis撰寫,共114頁、16幅圖和38張表,並將LLM視為一個有初始答案偏好的“接收者”。作者認為,外部證據會引發模型初始答案分佈的整體遷移;遷移的方向和強度由接收者自身的先驗權重與候選證據的傾斜方向共同決定。因此,同一個證據在不同模型或不同上下文中的作用可能截然相反。

基於這套分佈理論,研究給出三個預測:第一,接收者認為更可能的候選答案具有更強説服力;第二,模型更樂於整合自己容易產生的“特徵性錯誤”,而非來自其他來源的陌生錯誤;第三,完全相同的證據可能提升較弱模型的表現,同時損害較強模型的表現。這種接收者相對可靠性邊界還顯示,與模型固有偏好一致的誤差對性能的破壞,明顯高於同概率的隨機誤差。團隊通過1000萬次試驗、四個模型家族中的12個LLM以及八個不同領域驗證了這些結論;其中量子力學、物理、遺傳學和分子生物學屬於物理與生命科學中的科學發現任務。

尤其值得警惕的是,模型在接受外部候選答案之前即使已在內部驗證其無效,仍然會以極高概率將其整合:在有命題約束的設置中為93%至100%,在保留的物理和生命科學推理問題上最高達99.4%。這説明,證據整合並不是簡單地用對來源的標量信任度去覆蓋模型判斷,而是由接收模型自身分佈決定的一種控制策略。

因果乾預實驗進一步揭示,候選答案整合發生在網絡後期,並表現為結構化步驟:先引入外部候選答案,再提升其狀態,最後把它遷移到最終答案狀態。雖然驗證過程的表徵在模型內部可以被解碼,卻對答案几乎沒有因果影響;J-lens分解也表明,支持“口頭驗證”的內部狀態與支持“候選整合”的內部狀態可以完全分離。這項研究對檢索增強生成、多智能體協作以及AI工具調用場景中的錯誤傳播提出了新的風險建模思路。

展開要點與分析

文章情報

工程師中級

要點

  • 外部證據會使模型對初始答案的概率分佈發生遷移,而不是作為可信度標量被直接採納。
  • 在12個LLM、1000萬次試驗中,模型更傾向於整合與自己特徵性錯誤一致的證據。
  • 即使內部驗證出候選無效,模型仍有93%到100%的概率將其整合,驗證狀態對最終答案几乎無因果影響。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。