觀點:LLM中的不確定性量化只是無監督聚類
本文指出當前大型語言模型(LLM)中的不確定性量化(UQ)方法存在類別錯誤,本質上是無監督聚類算法,只衡量內部一致性而非外部正確性,無法檢測“自信幻覺”。作者識別出三種關鍵病理:超參數敏感性危機、內部評估循環混淆穩定性與真實性、缺乏真實標籤導致依賴不穩定代理指標。研究呼籲範式轉變,並提出了改進評估、原生不確定性和客觀真理錨定的路線圖。
一篇發表在ICML 2026的立場論文對當前大型語言模型(LLM)中的不確定性量化(UQ)方法提出了尖鋭批評。作者團隊來自知名研究機構,他們認為該領域存在根本性的類別錯誤:主流的UQ方法實際上是無監督聚類算法,而非真正的不確定性度量。這些方法量化的是模型生成內容的內部一致性,而非其與外部事實的符合程度。論文指出,由於依賴模型內部狀態,現有UQ方法對“自信幻覺”完全失效——當模型在穩定但錯誤的答案上表現出高置信度時,這些方法無法發出警報。這種缺陷在醫療、司法等高風險場景中尤為危險,可能給部署者帶來虛假的安全感。
具體而言,研究者識別出三種關鍵病理。首先是超參數敏感性危機:UQ方法的性能極度依賴於難以調試的閾值和參數設置,使得實際部署變得不安全。其次是內部評估循環:現有評估指標將穩定性與正確性混為一談,導致模型可能在追求一致性時犧牲事實準確性。最後是缺乏真實標註:由於無法獲取真實答案,研究者不得不依賴不穩定的代理指標來評估不確定性,進一步加劇了問題。
為解決這一困境,論文提出三條轉型路線:一是採用更嚴格的評估指標和實驗設置,例如引入外部知識庫驗證;二是改變模型機制,使其輸出內在的不確定性估計,而非通過採樣來推斷;三是將目標真理作為校準錨點,確保模型置信度成為現實可靠性的代理。作者強調,只有跳出內部循環,才能真正發揮UQ的安全防護作用。
該論文被ICML 2026收錄為立場論文,目前已上線arXiv。相關代碼和數據將於近期公開,為後續研究提供基準。該研究由Tiejin Chen等四位作者完成,論文編號arXiv:2605.19220,主要涉及自然語言處理、人工智能和機器學習領域。