超越Shapley:面向LLM对齐与评估的基于影响力的数据审计流程
提出一种可扩展的、仅需推理的数据估值流程,近似Shapley值无需迭代训练,通过语义k-NN图评估数据效用,在HelpSteer2和HH-RLHF数据集上减少人工审计搜索空间99.1%,并发现数千隐藏的偏好反转,暴露基准测试标签缺陷。
大型语言模型(LLM)的对齐越来越依赖于数据质量。随着数据集规模的扩大,海量的偏好和指令微调语料库不可避免地积累了隐藏的结构性矛盾、安全风险以及系统性的人工标注错误。标准的数据集审计方法,如语义去重或LLM-as-a-judge,难以捕捉单个记录的实际预测影响,常常遗漏深层次的功能规则冲突。
为了应对这一挑战,研究人员提出了一种可扩展的、仅需推理的数据估值流程,该流程无需迭代模型重新训练即可近似Shapley值。通过将语义k近邻(k-NN)邻域映射为有向图,该框架直接通过参考LLM的概率分布,利用零样本和单样本条件对数似然变化来评估数据效用。随后,该流程将这些预测性影响得分转化为局部优势度量,以隔离梯度冲突的记录。
研究团队在两个经过严格审查的对齐数据集上验证了该流程的有效性。首先,将流程应用于HelpSteer2数据集,使得人工审计搜索空间减少了99.1%,并成功发现了跨多种故障模式的错误标注记录。其次,对Anthropic的HH-RLHF训练集和评估集应用自动审计策略,识别出数千个隐藏的安全性和事实偏好反转。重要的是,将审计扩展到评估集后,暴露了当前基准测试完整性的严重漏洞:高性能模型往往能预测更安全或更有帮助的回应,却因客观上存在缺陷的人类真实标签而受到惩罚。
总体而言,该工作提供了一种数学上严谨、高效的诊断工具,用于发现人类标注错误、清理评估基准,并确保LLM对齐数据的完整性。这一方法不仅提高了数据审计的效率,还为AI对齐研究提供了新的视角,有助于构建更可靠的AI系统。