大型語言模型的資訊辨別能力
一項新研究揭示了大型語言模型(LLM)在整合外部資訊時存在顯著缺陷:它們幾乎無法區分可靠與不可靠的來源,對資訊真實性的判斷也接近隨機水平。研究引入了Learn2Discern框架,透過對13個模型、近67萬次試驗的測試,發現模型更傾向於依賴來源的流行度而非可靠性,並且無論資訊是否接近真相,其更新程度幾乎相同。使用者調查(n=299)證實,這些缺陷會降低使用者信任和使用意願。研究還提出了一些簡單的推理時干預措施,可部分改善資訊辨別能力。
大型語言模型(LLM)正被越來越多地用於從網際網路等外部來源整合知識,但它們能否恰當評估資訊的可靠性?這是亞利桑那大學和微軟研究院研究團隊在一篇新論文中探討的核心問題。他們正式定義了“資訊辨別”概念,並推出了Learn2Discern(L2D)框架。該框架基於三條規範公理,配有可解釋的指標,旨在量化模型在來源辨別(是否更信任可靠來源)和真相辨別(是否根據事實更新信念)兩個維度上的表現。為了驗證這些公理的外部有效性,研究團隊進行了一項預先註冊、配額匹配的使用者調查(n=299)。結果顯示,真實的LLM使用者普遍認可所有三條公理,並報告說如果模型違反這些公理,他們的信任和使用意願會顯著降低。
在對13個主流模型(包括GPT-4、Claude、Llama系列等)進行的近67萬次系統試驗中,研究人員發現了持續且顯著的失敗模式。在來源辨別任務上,模型對來源流行度的依賴程度幾乎是來源可靠性的兩倍,這意味著它們更容易被廣泛傳播的資訊影響,而非來自權威來源的資訊。在真相辨別任務上,模型的表現接近隨機水平:無論一條宣告是使模型的先驗更接近真實還是更遠離真實,模型更新的幅度幾乎相同。值得注意的是,模型在自身先驗已經最準確的資料集上整合外部知識的效果最好,這暗示模型可能更傾向於確認自己的已有知識,而非真正學習和修正。
研究還發現,儘管較新和較大的模型在真相辨別能力上有所提升,但來源辨別能力並未隨之改善,這表明模型複雜性的增加並不能自動解決這一盲點。為了應對這些挑戰,研究人員提出了一些簡單的推理時干預措施,例如修改提示詞或對輸出進行後處理,這些措施能同時改善兩種辨別能力。研究人員強調,隨著LLM逐步取代傳統搜尋引擎成為資訊獲取的主要途徑,資訊辨別這一核心對齊屬性的重要性將日益凸顯。他們已經公開了此次研究使用的資料集和調查問卷,作為測試基準供學術界和工業界進一步研究和評估。該論文於2026年5月22日提交至arXiv,主題涵蓋人工智慧、計算語言學以及計算機與社會等領域。