將法官編碼化:透過程式蒸餾實現可擴充套件評估
本文提出了一種名為程式蒸餾的替代方案,用於解決LLM作為評估者的高成本、高延遲和不透明問題。透過將LLM的決策邏輯蒸餾為程式委員會,實現了透明、可編輯且無API成本的評估。系統PAJAMA進一步結合了程式法官的聯合裁決和低置信度回退機制,在多個資料集上達到13B規模LLM法官的效能,並在RewardBench上以極低的API成本取得了更好的獎勵模型效果。
在人工智慧技術飛速發展的今天,大型語言模型(LLM)作為評估器(LLM-as-a-judge)已成為自動化評估的標準方法。然而,這種方法存在高昂的API呼叫成本、顯著的延遲以及決策過程不透明等固有問題,這些侷限性嚴重製約了其可擴充套件性和可靠性。針對這些挑戰,來自威斯康星大學麥迪遜分校的研究團隊Tzu-Heng Huang、Shengqi Qiu和Frederic Sala提出了一種簡單而高效的替代方案:程式蒸餾(Program Distillation)。相關論文於2026年5月29日提交至arXiv預印本平臺。
程式蒸餾的核心思想在於,將LLM的決策邏輯蒸餾為一組程式(programs),這些程式組成一個委員會,直接對候選輸出進行評分。與傳統的LLM-as-a-judge方法在每次評估時都需要呼叫LLM不同,程式化評判器(programmatic judges)在評估過程中無需任何API呼叫,從而將成本降至極低水平。此外,這些程式是完全透明的,研究人員可以輕鬆地檢查、編輯甚至重寫它們,這大大提高了評估過程的可解釋性和可控性。
基於這一理念,研究團隊進一步開發了PAJAMA系統。該系統能夠自動合成程式作為評判器,並將多個程式評判器的決策彙總成一個聯合裁決。更為精妙的是,PAJAMA還引入了一種回退機制(fallback mechanism):當程式評判器對某個案例的置信度較低時,系統會將該案例選擇性地上報給LLM進行判斷。這種設計在保證評估準確率的同時,有效控制了成本。
實驗結果表明,在涵蓋五個不同資料集和四個模型家族的廣泛測試中,程式化評判器的效能可以與13B引數規模的LLM評判器相媲美。當將程式輸出作為路由訊號時,PAJAMA系統不僅提高了準確率和吞吐量,還成功推進了帕累託前沿。這意味著該系統在多個效能指標上實現了更好的權衡。
更令人印象深刻的是,程式化評判器還能產生廉價且有效的獎勵訊號。在RewardBench基準測試中,基於程式評判結果蒸餾得到的獎勵模型(reward model),其效能超越了基於專有LLM標籤訓練的獎勵模型,而API成本卻降低了整整兩個數量級。這一成果凸顯了程式蒸餾在模型訓練和評估中的巨大潛力。
這項研究為AI評估領域提供了一種全新的思路。透過將LLM的“評判智慧”轉化為可讀、可編輯的程式程式碼,程式蒸餾技術有望在不犧牲評估質量的前提下,大幅降低成本和延遲,同時提升系統的透明度和可靠性。未來,這種程式化評估方法可能廣泛應用於各種需要自動化評估的場景,例如模型對齊、強化學習中的獎勵建模,以及大規模模型效能的持續監控等。隨著該技術的進一步成熟,我們有理由期待AI評估將變得更加高效、經濟和可解釋。