AI News HubLIVE
站内改写2 分钟阅读

HSS-Synth:面向大语言模型的人文与社会科学数据合成

一项新研究提出 HSS-Synth,首个面向人文与社会科学(HSS)的数据合成流水线,覆盖14个主流领域,生成23.7万条高质量指令微调样本,在16项基准上超越14个基线,并让Qwen3-8B-Base逼近官方版本。

来源arXiv Computational Linguistics作者: Ru Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang, Junyang Lin, Dayiheng Liu, Junbo Zhao

大语言模型(LLM)的性能高度依赖训练数据的质量与多样性,然而高质量数据往往稀缺且获取成本高昂。数据合成被广泛视为一种可行的替代方案,并且在封闭式任务上已经取得了显著成功。但人文与社会科学(HSS)领域却长期被忽视,其开放式、主观性强的特点使得数据合成极具挑战。针对这一研究空白,Ru Peng 等 12 位研究者联合提出了一项名为 HSS-Synth 的数据合成流水线,据称是首个专门面向 HSS 领域的系统性解决方案。

研究团队摒弃了以往以能力为中心、碎片化的研究思路,转向以学科为中心的范式。他们首次定义了一个覆盖 14 个主流领域的人文社科领域体系,并在此基础上构建了 HSS-Synth。该流水线由三个核心环节构成:第一,从网络语料中构建种子文档,通过多步过滤和文本精炼,并借助一个评判模型对文档质量进行评估;第二,通过指定“需求 + 人设”的方式,将种子文档反向翻译为多样且忠实的指令,同时配套严格的问答对齐检查,确保生成的指令既丰富多样又与原始语义高度一致;第三,采用教师强制的回答生成方式,在模型生成响应时将种子文档作为输入注入,以锚定语义、减少幻觉,同时保持语气与内容的完整性。

利用这一流水线,研究团队成功生成了 23.7 万条高质量、多样化的指令微调样本。在实验评估中,使用这些数据微调后的 Qwen3-8B-Base 在 16 项基准测试中超越了 14 个领先基线,创下了该规模模型的最新纪录,并且其性能非常接近官方 Qwen3-8B。值得注意的是,研究还发现模型在人类偏好和知识能力两个维度上均获得了提升,没有出现此前常见的那种“性能跷跷板”现象,即一种能力提升以另一种能力下降为代价。此外,大规模实验还充分证明了 HSS-Synth 的稳健性和可迁移性,表明该方法在不同设置和数据条件下都能保持有效。

该论文已于 2026 年 7 月 29 日提交至 arXiv 预印本平台,编号为 2607.27379,并已被 ACL Findings 2026 会议接收。研究团队已在 https://github.com/pengr/HSS-Synth 上公开了完整代码,以便研究社区复现实验结果、验证方法有效性并在此基础上开展进一步研究。