AI News HubLIVE
站内改写1 分钟阅读

DataPrep-Bench:将大语言模型作为训练数据准备者的基准测试

DataPrep-Bench是首个统一基准,联合评估大语言模型在数据构建和数据质量评估两个互补能力上的表现,涵盖六个领域和多种基础模型。该基准引入了Data-Construction-Skill智能体和Distributional Alignment Score (DAS)评估指标,在多个领域取得了领先结果。

来源arXiv Machine Learning作者: Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

训练数据的质量从根本上决定了大型语言模型(LLM)的能力,然而,目前尚无统一的基准来衡量LLM、智能体以及数据中心工作流在端到端准备训练数据方面的表现。为填补这一空白,Hao Liang等研究者提出了DataPrep-Bench,这是首个能够在共享的下游训练协议下,联合评估LLM驱动的数据准备工作中两个互补能力的统一基准。这两个能力分别是:数据构建(data construction),即将原始来源转化为监督训练数据;以及数据质量评估(data quality evaluation),即在训练前预测候选数据集的价值。这里的“质量”特指下游训练中的实用性,而非表面的文本特性。

DataPrep-Bench覆盖了金融、数学、科学、医学等六个不同领域,并使用多种基础模型进行评估。在数据构建方面,所有方法都使用相同的原始数据源,并通过将模型输出与Dolly-15k联合微调来评分。研究人员还发布了Data-Construction-Skill,一个技能引导的智能体,在Llama-3.1-8B模型上,针对金融领域,将仅使用Dolly的基线提升了近20个绝对百分点,并且在知识提取密集的领域(如医学)中,与最强大的基于智能体和DataFlow的方法性能相当。

在数据质量评估方面,评分函数通过皮尔逊相关系数(Pearson correlation)与共享候选池上的下游性能进行评分。研究者提出了Distributional Alignment Score (DAS),这是一种基于分布的评估器,利用候选数据集与领域代理之间的最大均值差异(MMD)。DAS在六个领域中的四个达到了最强的跨模型相关性,并且是唯一在数学、科学和医学三个领域同时超过r>0.70的指标,显著优于现有的基于质量、多样性和启发式的评估器。

DataPrep-Bench提供了一个以下游训练为根基的框架,将数据构建和数据质量评估视为LLM驱动数据准备的两个同等重要的目标。该基准有望加速对数据中心AI的研究,帮助社区开发更高效、更高质量的训练数据准备方法,从而推动LLM能力的进一步提升。相关代码和模型已公开,供研究者使用。