AI News HubLIVE
站内改写2 分钟阅读

将法官编码化:通过程序蒸馏实现可扩展评估

本文提出了一种名为程序蒸馏的替代方案,用于解决LLM作为评估者的高成本、高延迟和不透明问题。通过将LLM的决策逻辑蒸馏为程序委员会,实现了透明、可编辑且无API成本的评估。系统PAJAMA进一步结合了程序法官的联合裁决和低置信度回退机制,在多个数据集上达到13B规模LLM法官的性能,并在RewardBench上以极低的API成本取得了更好的奖励模型效果。

来源arXiv AI作者: Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

在人工智能技术飞速发展的今天,大型语言模型(LLM)作为评估器(LLM-as-a-judge)已成为自动化评估的标准方法。然而,这种方法存在高昂的API调用成本、显著的延迟以及决策过程不透明等固有问题,这些局限性严重制约了其可扩展性和可靠性。针对这些挑战,来自威斯康星大学麦迪逊分校的研究团队Tzu-Heng Huang、Shengqi Qiu和Frederic Sala提出了一种简单而高效的替代方案:程序蒸馏(Program Distillation)。相关论文于2026年5月29日提交至arXiv预印本平台。

程序蒸馏的核心思想在于,将LLM的决策逻辑蒸馏为一组程序(programs),这些程序组成一个委员会,直接对候选输出进行评分。与传统的LLM-as-a-judge方法在每次评估时都需要调用LLM不同,程序化评判器(programmatic judges)在评估过程中无需任何API调用,从而将成本降至极低水平。此外,这些程序是完全透明的,研究人员可以轻松地检查、编辑甚至重写它们,这大大提高了评估过程的可解释性和可控性。

基于这一理念,研究团队进一步开发了PAJAMA系统。该系统能够自动合成程序作为评判器,并将多个程序评判器的决策汇总成一个联合裁决。更为精妙的是,PAJAMA还引入了一种回退机制(fallback mechanism):当程序评判器对某个案例的置信度较低时,系统会将该案例选择性地上报给LLM进行判断。这种设计在保证评估准确率的同时,有效控制了成本。

实验结果表明,在涵盖五个不同数据集和四个模型家族的广泛测试中,程序化评判器的性能可以与13B参数规模的LLM评判器相媲美。当将程序输出作为路由信号时,PAJAMA系统不仅提高了准确率和吞吐量,还成功推进了帕累托前沿。这意味着该系统在多个性能指标上实现了更好的权衡。

更令人印象深刻的是,程序化评判器还能产生廉价且有效的奖励信号。在RewardBench基准测试中,基于程序评判结果蒸馏得到的奖励模型(reward model),其性能超越了基于专有LLM标签训练的奖励模型,而API成本却降低了整整两个数量级。这一成果凸显了程序蒸馏在模型训练和评估中的巨大潜力。

这项研究为AI评估领域提供了一种全新的思路。通过将LLM的“评判智慧”转化为可读、可编辑的程序代码,程序蒸馏技术有望在不牺牲评估质量的前提下,大幅降低成本和延迟,同时提升系统的透明度和可靠性。未来,这种程序化评估方法可能广泛应用于各种需要自动化评估的场景,例如模型对齐、强化学习中的奖励建模,以及大规模模型性能的持续监控等。随着该技术的进一步成熟,我们有理由期待AI评估将变得更加高效、经济和可解释。