RankJudge:用於多輪對話的LLM評判合成基準生成器
RankJudge是一種新型基準生成器,專門用於評估LLM在多輪對話中的評判能力。它透過建立成對的對話(其中一方在單輪中注入一個缺陷)實現無歧義的優劣標註,並精確隔離失敗類別。該方法在機器學習、生物醫學和金融三個領域進行了實施,評估了21個前沿LLM評判模型,並使用Bradley-Terry模型進行排名。研究還透過難度評級動態篩選評估資料,減少了標籤噪聲。
隨著基於LLM的互動式應用不斷湧現和完善,模型開發者需要從多個維度評估生成文本的質量。對於簡單系統,人工評估可能可行,但在複雜的對話聊天機器人等系統中,生成的文本量可能遠超人工標註資源的處理能力。因此,模型開發者開始大量依賴自動評估,即使用LLM本身來評判生成質量。然而,現有的LLM作為評判者的基準主要集中於簡單的問答任務,未能匹配多輪對話的複雜性。
針對這一空白,研究團隊提出了RankJudge,這是一個專為評估LLM在多輪對話中評判能力而設計的基準生成器。RankJudge的核心創新在於建立成對的對話:其中一段對話在某一輪中注入一個單一的缺陷,而另一段對話保持完美。這種構造使得成對對話可以無歧義地標註為“更好”或“更差”,並且能夠將失敗類別精確隔離到具體的輪次,從而實現嚴格的聯合正確性評判標準。
研究團隊在機器學習、生物醫學和金融三個領域實施了RankJudge,並評估了21個前沿LLM作為評判者的表現,隨後使用Bradley-Terry模型對它們進行排名。該公式還能夠為每對對話分配難度評級,研究團隊利用這一評級動態篩選評估資料集,以減少標籤噪聲——這一效果已透過人工標註得到驗證。此外,實驗發現,在部分可觀測性、較粗糙的正確性標準以及另一種隨機遊走評分演算法下,評判者的排名保持穩定。
RankJudge為多輪對話中的LLM評判能力評估提供了一個可靠且可擴充套件的框架,有助於推動更復雜LLM應用的發展。其設計原理和實驗結果在arXiv論文(2605.21748)中有詳細描述,該論文由Zhenwei Tang等五位作者於2026年5月20日提交。論文還探討了RankJudge在減少評估偏差和提升基準可靠性方面的潛力,為未來LLM評估研究提供了新的方向。