2026年9月3日提交至arXiv的一篇論文提出了一個系統性框架,用於理解大語言模型如何利用外部證據。論文由Sebastien Kawada和Manolis Kellis撰寫,共114頁、16幅圖和38張表,並將LLM視為一個有初始答案偏好的“接收者”。作者認為,外部證據會引發模型初始答案分佈的整體遷移;遷移的方向和強度由接收者自身的先驗權重與候選證據的傾斜方向共同決定。因此,同一個證據在不同模型或不同上下文中的作用可能截然相反。
基於這套分佈理論,研究給出三個預測:第一,接收者認為更可能的候選答案具有更強說服力;第二,模型更樂於整合自己容易產生的“特徵性錯誤”,而非來自其他來源的陌生錯誤;第三,完全相同的證據可能提升較弱模型的表現,同時損害較強模型的表現。這種接收者相對可靠性邊界還顯示,與模型固有偏好一致的誤差對效能的破壞,明顯高於同機率的隨機誤差。團隊透過1000萬次試驗、四個模型家族中的12個LLM以及八個不同領域驗證了這些結論;其中量子力學、物理、遺傳學和分子生物學屬於物理與生命科學中的科學發現任務。
尤其值得警惕的是,模型在接受外部候選答案之前即使已在內部驗證其無效,仍然會以極高機率將其整合:在有命題約束的設定中為93%至100%,在保留的物理和生命科學推理問題上最高達99.4%。這說明,證據整合並不是簡單地用對來源的標量信任度去覆蓋模型判斷,而是由接收模型自身分佈決定的一種控制策略。
因果乾預實驗進一步揭示,候選答案整合發生在網路後期,並表現為結構化步驟:先引入外部候選答案,再提升其狀態,最後把它遷移到最終答案狀態。雖然驗證過程的表徵在模型內部可以被解碼,卻對答案几乎沒有因果影響;J-lens分解也表明,支援“口頭驗證”的內部狀態與支援“候選整合”的內部狀態可以完全分離。這項研究對檢索增強生成、多智慧體協作以及AI工具呼叫場景中的錯誤傳播提出了新的風險建模思路。