RankJudge:用于多轮对话的LLM评判合成基准生成器
RankJudge是一种新型基准生成器,专门用于评估LLM在多轮对话中的评判能力。它通过创建成对的对话(其中一方在单轮中注入一个缺陷)实现无歧义的优劣标注,并精确隔离失败类别。该方法在机器学习、生物医学和金融三个领域进行了实施,评估了21个前沿LLM评判模型,并使用Bradley-Terry模型进行排名。研究还通过难度评级动态筛选评估数据,减少了标签噪声。
随着基于LLM的交互式应用不断涌现和完善,模型开发者需要从多个维度评估生成文本的质量。对于简单系统,人工评估可能可行,但在复杂的对话聊天机器人等系统中,生成的文本量可能远超人工标注资源的处理能力。因此,模型开发者开始大量依赖自动评估,即使用LLM本身来评判生成质量。然而,现有的LLM作为评判者的基准主要集中于简单的问答任务,未能匹配多轮对话的复杂性。
针对这一空白,研究团队提出了RankJudge,这是一个专为评估LLM在多轮对话中评判能力而设计的基准生成器。RankJudge的核心创新在于创建成对的对话:其中一段对话在某一轮中注入一个单一的缺陷,而另一段对话保持完美。这种构造使得成对对话可以无歧义地标注为“更好”或“更差”,并且能够将失败类别精确隔离到具体的轮次,从而实现严格的联合正确性评判标准。
研究团队在机器学习、生物医学和金融三个领域实施了RankJudge,并评估了21个前沿LLM作为评判者的表现,随后使用Bradley-Terry模型对它们进行排名。该公式还能够为每对对话分配难度评级,研究团队利用这一评级动态筛选评估数据集,以减少标签噪声——这一效果已通过人工标注得到验证。此外,实验发现,在部分可观测性、较粗糙的正确性标准以及另一种随机游走评分算法下,评判者的排名保持稳定。
RankJudge为多轮对话中的LLM评判能力评估提供了一个可靠且可扩展的框架,有助于推动更复杂LLM应用的发展。其设计原理和实验结果在arXiv论文(2605.21748)中有详细描述,该论文由Zhenwei Tang等五位作者于2026年5月20日提交。论文还探讨了RankJudge在减少评估偏差和提升基准可靠性方面的潜力,为未来LLM评估研究提供了新的方向。