超越Shapley:面向LLM對齊與評估的基於影響力的數據審計流程
提出一種可擴展的、僅需推理的數據估值流程,近似Shapley值無需迭代訓練,通過語義k-NN圖評估數據效用,在HelpSteer2和HH-RLHF數據集上減少人工審計搜索空間99.1%,並發現數千隱藏的偏好反轉,暴露基準測試標籤缺陷。
大型語言模型(LLM)的對齊越來越依賴於數據質量。隨着數據集規模的擴大,海量的偏好和指令微調語料庫不可避免地積累了隱藏的結構性矛盾、安全風險以及系統性的人工標註錯誤。標準的數據集審計方法,如語義去重或LLM-as-a-judge,難以捕捉單個記錄的實際預測影響,常常遺漏深層次的功能規則衝突。
為了應對這一挑戰,研究人員提出了一種可擴展的、僅需推理的數據估值流程,該流程無需迭代模型重新訓練即可近似Shapley值。通過將語義k近鄰(k-NN)鄰域映射為有向圖,該框架直接通過參考LLM的概率分佈,利用零樣本和單樣本條件對數似然變化來評估數據效用。隨後,該流程將這些預測性影響得分轉化為局部優勢度量,以隔離梯度衝突的記錄。
研究團隊在兩個經過嚴格審查的對齊數據集上驗證了該流程的有效性。首先,將流程應用於HelpSteer2數據集,使得人工審計搜索空間減少了99.1%,併成功發現了跨多種故障模式的錯誤標註記錄。其次,對Anthropic的HH-RLHF訓練集和評估集應用自動審計策略,識別出數千個隱藏的安全性和事實偏好反轉。重要的是,將審計擴展到評估集後,暴露了當前基準測試完整性的嚴重漏洞:高性能模型往往能預測更安全或更有幫助的回應,卻因客觀上存在缺陷的人類真實標籤而受到懲罰。
總體而言,該工作提供了一種數學上嚴謹、高效的診斷工具,用於發現人類標註錯誤、清理評估基準,並確保LLM對齊數據的完整性。這一方法不僅提高了數據審計的效率,還為AI對齊研究提供了新的視角,有助於構建更可靠的AI系統。