相同問題,不同答案:超越準確率評估LLM可靠性
研究表明,大型語言模型(LLM)在基準測試中常獲高準確率,但當同一問題以不同但等價的方式表述時,其答案可能改變。研究涵蓋四個基準和13個模型,發現例項級行為不穩定,不匹配率超過23%。模型雖常有正確知識但檢索不一致,自釋義策略可部分恢復潛在知識並提升效能。
近日,arXiv上釋出了一篇來自Kazem Faghih等六位作者的論文(編號2607.22554),該論文深入探討了大型語言模型(LLM)的可靠性問題。研究指出,雖然LLM在標準基準測試中往往表現出高準確率,但當同一問題以不同但語義等價的措辭提出時,模型的回答可能會發生變化,這引發了對其實際可靠性的質疑。
研究團隊在四個基準測試上評估了13個模型,這些測試涵蓋事實問答和數學推理任務。他們透過生成意義保持的釋義文本來觀察模型答案的變化。結果顯示,雖然整體準確率在不同釋義之間變化不大,但個體例項的行為卻極不穩定。對於許多問題,模型根據措辭的不同在正確與錯誤答案之間搖擺,不匹配率高達23%以上。特別值得注意的是,當僅考慮原始措辭答對的問題時,答案翻轉率甚至更高,這表明單一提示的正確性遠非衡量可靠性的可靠指標。
有趣的是,研究人員發現,模型通常能對至少一種釋義給出正確答案。這暗示著相關知識實際上儲存在模型中,但無法被一致地檢索出來。基於這一觀察,他們提出了一種簡單的“自釋義”策略:在推理時,讓模型對同一問題生成多種釋義,然後聚合所有答案。實驗證明,這種方法能夠部分恢復潛在知識,從而提升整體效能。
該研究的結論強調,標準準確率指標可能掩蓋了LLM內在的不穩定性。要更清晰地評估LLM的可靠性,需要考察模型在等價輸入上的一致性表現。這項工作為未來LLM的評估和部署提供了重要的參考,提醒我們在依賴模型輸出前必須關注其在不同措辭下的穩定性。