AI News HubLIVE
站內改寫1 分鐘閱讀

當證據衝突時:檢索增強型生物醫學問答中的不確定性與順序效應

本研究通過HealthContradict數據集評估了六個開源大語言模型在五種證據條件下的表現,發現矛盾證據導致準確率下降11.4%–25.2%的預測翻轉。提出的衝突感知棄權分數在困難條件下將選擇性準確率提升最多33.4個百分點。

來源arXiv Computational Linguistics作者: Yikun Han, Mengfei Lan, Halil Kilicoglu

檢索增強生成(RAG)系統在生物醫學領域面臨獨特挑戰:從文獻中檢索到的證據可能不完整、具有誤導性甚至相互矛盾。然而,現有評估方法通常只關注模型在有益上下文下的準確性,忽視了矛盾證據對可靠性的影響。這項發表於BioNLP 2026的研究系統性地探討了這一問題。

研究團隊創建了HealthContradict數據集,並設計了五種檢索條件:無檢索上下文、僅正確上下文、僅錯誤上下文,以及兩種包含正確和矛盾文檔的混合條件(文檔順序相反)。實驗覆蓋了六個開源大語言模型,包括Llama和Mistral系列等。

關鍵發現表明,當同一組正確和錯誤文檔僅順序顛倒時,所有模型的準確率均出現下降,且11.4%至25.2%的預測結果發生翻轉。這一順序效應揭示了模型對證據呈現順序的敏感性,而不僅僅是證據內容本身。例如,在錯誤文檔優先呈現的條件下,模型更容易受到誤導。

為應對這些困難情況,研究者開發了一種衝突感知棄權分數,該分數綜合了模型置信度和證據衝突檢測器的輸出。在僅包含錯誤文檔(IC)和錯誤文檔優先呈現的衝突條件(ICC)這兩種最困難條件下,該分數在75%、50%和25%覆蓋率下將選擇性準確率平均提升7.2至33.4個百分點(IC條件)和3.6至14.4個百分點(ICC條件),相比僅依賴置信度的方法有顯著改善。

這項工作將矛盾證據定義為不確定性和魯棒性的雙重問題,並呼籲開發明確考慮證據不一致性的評估和棄權方法。對於臨牀決策支持等高危應用,該研究具有重要意義——當模型面臨衝突信息時,準確棄權可能比冒險作答更為安全。研究者還指出,未來工作可以探索更復雜的衝突檢測機制和動態證據排序策略,以進一步提升RAG系統在真實環境中的可靠性。