AI News HubLIVE
站內改寫1 分鐘閱讀

基於結構化專家判斷的多LLM系統不確定性感知信任估計

本文提出了一種不確定性感知的信任估計方法,用於多LLM系統聚合,通過模仿決策理論中的結構化專家判斷,採用Cooke對數加權來校準各LLM的可信度,實驗表明在異構和污染場景下該方法優於傳統聚合方式。

來源arXiv Machine Learning作者: Jiawei Zheng, Jiazhen Zhang

大型語言模型(LLM)集成系統通過組合多個模型的預測來提高可靠性,這種策略在自然語言處理任務中應用日益廣泛。然而,現有的聚合方法(如平均、多數投票)通常假設所有模型具有同等的可信度,忽略了它們在不確定性量化質量上的顯著差異。這一假設在處理異構LLM(如不同規模、訓練數據和架構的模型)時存在明顯缺陷,因為不同LLM的可信度和能力差異顯著,簡單的聚合容易受到不可靠甚至對抗性專家的影響,導致整體性能下降。針對這一侷限,來自Jiawei Zheng和Jiazhen Zhang的研究團隊將多LLM聚合問題形式化為不確定性感知的信任估計問題。他們從決策理論中引入結構化專家判斷(SEJ)方法,利用上下文感知的校準問題來估計專家可靠性,具體基於其概率預測的質量。核心創新是採用Cooke式對數加權,該方法對過度自信的錯誤預測施加懲罰,同時傾向於經過良好校準的專家,從而動態調整各LLM在聚合中的權重。研究團隊在MMLU和MMLU-Pro數據集上進行了全面的實驗評估,涵蓋了同質、異質以及受污染的專家面板(即包含故意提供錯誤答案的模型)。實驗結果顯示,在專家同質的情況下(如使用相同架構的模型),各種聚合方法的性能相似;但在專家異質性和污染存在的情況下,Cooke加權方法展現出關鍵價值,其準確性與可靠性的平衡優於傳統方法,並且對不可靠專傢俱有魯棒性。這項研究於2026年7月10日提交至arXiv(編號2607.20529),屬於機器學習(cs.LG)和人工智能(cs.AI)領域。這些發現表明,多LLM聚合不僅需要簡單組合預測結果,更需要在不確定性環境下對信任進行校準。該工作為構建更可靠、更魯棒的多模型集成系統提供了新的理論基礎和實踐指導,尤其在需要高可靠性的應用場景(如醫療診斷、法律分析等)中具有重要潛力。