AI News HubLIVE
站內改寫1 分鐘閱讀

隨機取樣在認知上淺薄:LLM溫度變化與模型多樣性之間的維度差距

研究發現,透過溫度取樣重複執行單個LLM得到的答案變化(自一致性)只能揭示單一維度的結構,而使用多個不同模型的整合則能檢測到更多跨問題的訊號,從而更全面地揭示模型不知道的內容。

來源arXiv AI作者: Izhar Ali

一篇新研究論文《隨機取樣在認知上淺薄:LLM溫度變化與模型多樣性之間的維度差距》探討了大型語言模型(LLM)中不確定性估計的方法。該研究由Izhar Ali等人完成,已被EIML@ICML 2026接收。研究的核心問題是:當語言模型在重複執行時給出不同答案,這種變化是否能揭示模型不知道的內容?自一致性方法透過多數投票將這種變化轉化為每個問題的不確定性估計,但它是否能像多樣化的整合一樣,揭示跨問題的結構——即相關問題是否同時翻轉?

研究比較了兩種方案:對同一組問題,將單個LLM在溫度τ=1下執行100次,與24個不同LLM在溫度τ=0下各執行一次組成整合。使用Marchenko-Pastur隨機矩陣測試來分離訊號和取樣噪聲。結果在五個模型家族和三個基準(MMLU、HellaSwag、GSM8K)上一致顯示:任何單個模型最多隻有一個維度高於噪聲水平。相比之下,24個模型的整合則產生四個高於噪聲邊緣的特徵值,而匹配難度的伯努利零假設在500次蒙特卡洛模擬中最多產生一個。

這表明,儘管自一致性(透過多數投票)能準確估算單個問題的置信度,但它無法揭示問題之間的結構相關性。只有透過多樣化的模型整合,才能更全面地揭示模型不知道的內容。研究強調了整合方法在不確定性量化中的價值,並指出了溫度取樣作為多樣性來源的侷限性。該發現對模型選擇、推理成本、產品能力和評估基準均有影響,提示從業者在需要深入理解模型知識邊界時應優先考慮模型多樣性而不是重複取樣。