AI News HubLIVE
站内改写2 分钟阅读

生成无奖励评判标准以减少智能体评估中的过度评分

一篇新的arXiv论文提出RubricForge方法,通过从少量带真值标签的轨迹中自动生成可读的评判标准,在不访问环境奖励的情况下评估语言模型智能体。与G-Eval等通用评判器相比,RubricForge将失败轨迹被误判为成功的比例降低约一半,并提升排序忠實性,同时保持判定可归因。

来源arXiv AI作者: Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

随着大语言模型智能体被大规模部署,如何自动评估其性能成为关键问题。最可靠的方式是执行环境中的奖励信号,但在部署时往往成本过高、速度太慢甚至完全不可用。因此,越来越多系统使用另一个语言模型作为“法官”,对智能体轨迹进行评分。这种无奖励的评判器是否可信,直接决定了评估结果的价值。

现有评判器通常采用两种做法:像G-Eval那样手工编写评分标准,或者对法官模型进行微调。然而,这两类方法都容易将流畅但不成功的轨迹判为成功,产生“过度评分”问题。针对这一缺陷,一篇由Darragh Quinn等六位作者提交至arXiv的论文提出了RubricForge。该方法不依赖手工规则,也不修改模型权重,而是从一小批带有真值标签的轨迹中,通过反思式进化自动生成一份人类可读的评分标准。

RubricForge 的工作流程是:先利用带环境奖励标签的轨迹作为监督信号,反复演化评判标准,直至其与真实奖励的吻合度最大化;随后将标准固定,并在推理时仅用一次模型调用对新的轨迹进行评分,全程无需访问环境。由于最终产物是可读文本,每个判定都能追溯到具体的评判条款,提升了可归因性和可审计性。

实验使用同一个冻结的7B模型同时充当智能体和法官,测试基准为tau-bench(从220次 rollout 中选取173条带标签轨迹)和WebShop(160条)。结果显示,RubricForge 的主要收益并非整体一致率,而是评判的忠实程度。在tau-bench上,它将失败轨迹被错误放行的比例从G-Eval的0.173降至0.115,并且发现三处过度评分、没有产生任何判定反转;在WebShop上,其排序与真实结果等级的Spearman相关系数为0.410,高于G-Eval的0.370。

不过,论文也如实报告了局限性。RubricForge 与通用G-Eval法官在总体一致率上的差异未达到统计显著(McNemar p=0.248);在绝对分数的校准上,G-Eval甚至略优(|err|差异为-0.048,p=2×10^-4)。作者强调,对于无奖励评估器,真正重要的是误放行率而非总体一致率,因为误放行会让有缺陷的智能体上线,而误拒绝最多只是增加一次重试成本。

总体来看,RubricForge 提供了一种可解释、低成本的智能体评估思路,尤其适合需要高可信度、低误放行率的部署场景。未来若能进一步提升其评分校准,并扩大验证的任务范围,有望成为强化学习智能体评估体系中的重要一环。