生成無獎勵評判標準以減少智能體評估中的過度評分
一篇新的arXiv論文提出RubricForge方法,通過從少量帶真值標籤的軌跡中自動生成可讀的評判標準,在不訪問環境獎勵的情況下評估語言模型智能體。與G-Eval等通用評判器相比,RubricForge將失敗軌跡被誤判為成功的比例降低約一半,並提升排序忠實性,同時保持判定可歸因。
隨着大語言模型智能體被大規模部署,如何自動評估其性能成為關鍵問題。最可靠的方式是執行環境中的獎勵信號,但在部署時往往成本過高、速度太慢甚至完全不可用。因此,越來越多系統使用另一個語言模型作為“法官”,對智能體軌跡進行評分。這種無獎勵的評判器是否可信,直接決定了評估結果的價值。
現有評判器通常採用兩種做法:像G-Eval那樣手工編寫評分標準,或者對法官模型進行微調。然而,這兩類方法都容易將流暢但不成功的軌跡判為成功,產生“過度評分”問題。針對這一缺陷,一篇由Darragh Quinn等六位作者提交至arXiv的論文提出了RubricForge。該方法不依賴手工規則,也不修改模型權重,而是從一小批帶有真值標籤的軌跡中,通過反思式進化自動生成一份人類可讀的評分標準。
RubricForge 的工作流程是:先利用帶環境獎勵標籤的軌跡作為監督信號,反覆演化評判標準,直至其與真實獎勵的吻合度最大化;隨後將標準固定,並在推理時僅用一次模型調用對新的軌跡進行評分,全程無需訪問環境。由於最終產物是可讀文本,每個判定都能追溯到具體的評判條款,提升了可歸因性和可審計性。
實驗使用同一個凍結的7B模型同時充當智能體和法官,測試基準為tau-bench(從220次 rollout 中選取173條帶標籤軌跡)和WebShop(160條)。結果顯示,RubricForge 的主要收益並非整體一致率,而是評判的忠實程度。在tau-bench上,它將失敗軌跡被錯誤放行的比例從G-Eval的0.173降至0.115,並且發現三處過度評分、沒有產生任何判定反轉;在WebShop上,其排序與真實結果等級的Spearman相關係數為0.410,高於G-Eval的0.370。
不過,論文也如實報告了局限性。RubricForge 與通用G-Eval法官在總體一致率上的差異未達到統計顯著(McNemar p=0.248);在絕對分數的校準上,G-Eval甚至略優(|err|差異為-0.048,p=2×10^-4)。作者強調,對於無獎勵評估器,真正重要的是誤放行率而非總體一致率,因為誤放行會讓有缺陷的智能體上線,而誤拒絕最多隻是增加一次重試成本。
總體來看,RubricForge 提供了一種可解釋、低成本的智能體評估思路,尤其適合需要高可信度、低誤放行率的部署場景。未來若能進一步提升其評分校準,並擴大驗證的任務範圍,有望成為強化學習智能體評估體系中的重要一環。