AI News HubLIVE
站內改寫1 分鐘閱讀

基於共識的大語言模型相對偏好評估框架

這篇論文提出了一種基於共識的大語言模型(LLM)評估框架,透過讓多個LLM對彼此的匿名輸出進行投票排名,計算相對智慧指數(RII),以衡量模型間的相對偏好,而非絕對正確性。研究發現,不同模型在某些領域存在一致的偏好模式,但該結果反映的是模型間的一致性,而非客觀正確性或人類判斷。該方法為存在多個有效答案的場景提供了一種可擴充套件的、模型驅動的比較評估方法。

來源arXiv Computational Linguistics作者: Mohtashim Khan

大語言模型(LLM)的評估一直是一個核心挑戰。傳統的基準測試通常依賴靜態資料集和客觀評分指標,例如準確率或困惑度。然而,當一個問題存在多個可接受的答案時,這些指標往往難以區分不同響應在清晰度、完整性和有用性方面的細微差別。針對這一問題,一篇由Mohtashim Khan撰寫的論文《基於共識的相對偏好評估框架》提出了一種全新的、基於共識的評估方法。

該框架的核心思想是:不再追求絕對的正確性,而是衡量LLM之間的相對偏好。具體來說,研究人員讓一組多樣化的LLM作為“評審委員會”,對同一提示詞生成的匿名響應進行獨立排名。透過彙總這些排名,計算出每個模型的“相對智慧指數”(Relative Intelligence Index, RII),該指數反映了該模型的輸出在其他模型中被偏好的頻率。這種方法將模型間的一致認可視為響應質量的替代指標。

在實驗中,作者選取了五個最先進的LLM,涵蓋程式設計、通用知識、安全、邏輯推理和數學等多個領域。每個模型首先生成響應,然後透過結構化的投票過程獨立評估其他模型的匿名輸出。結果顯示出跨領域的一致性偏好模式:某些模型被同行更頻繁地評為高質量。然而,論文明確指出,這些結果反映的是模型間的偏好對齊,而非客觀正確性或與人類判斷的對應。不過,先前的研究表明,聚合的模型偏好可能部分與人類評價相關,因此該方法可以作為近似訊號。

這一框架為LLM比較提供了一種可擴充套件、模型驅動的新視角,特別適用於那些存在多個有效答案的場景。儘管它與人類評估不完全一致,但其高效的自動化特性使其在模型開發和對比中具有潛在價值。該論文還探討了該方法的侷限性,例如可能存在的模型間偏差和對齊問題。

論文標題為《A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models》,提交至arXiv(ID: 2607.21632),共14頁,包含7張圖表。實驗細節和完整結果可在論文中查閱。

基於共識的大語言模型相對偏好評估框架 | AI News Hub