HSS-Synth:面向大語言模型的人文與社會科學資料合成
一項新研究提出 HSS-Synth,首個面向人文與社會科學(HSS)的資料合成流水線,覆蓋14個主流領域,生成23.7萬條高質量指令微調樣本,在16項基準上超越14個基線,並讓Qwen3-8B-Base逼近官方版本。
大語言模型(LLM)的效能高度依賴訓練資料的質量與多樣性,然而高質量資料往往稀缺且獲取成本高昂。資料合成被廣泛視為一種可行的替代方案,並且在封閉式任務上已經取得了顯著成功。但人文與社會科學(HSS)領域卻長期被忽視,其開放式、主觀性強的特點使得資料合成極具挑戰。針對這一研究空白,Ru Peng 等 12 位研究者聯合提出了一項名為 HSS-Synth 的資料合成流水線,據稱是首個專門面向 HSS 領域的系統性解決方案。
研究團隊摒棄了以往以能力為中心、碎片化的研究思路,轉向以學科為中心的正規化。他們首次定義了一個覆蓋 14 個主流領域的人文社科領域體系,並在此基礎上構建了 HSS-Synth。該流水線由三個核心環節構成:第一,從網路語料中構建種子文件,透過多步過濾和文本精煉,並藉助一個評判模型對文件質量進行評估;第二,透過指定“需求 + 人設”的方式,將種子文件反向翻譯為多樣且忠實的指令,同時配套嚴格的問答對齊檢查,確保生成的指令既豐富多樣又與原始語義高度一致;第三,採用教師強制的回答生成方式,在模型生成響應時將種子文件作為輸入注入,以錨定語義、減少幻覺,同時保持語氣與內容的完整性。
利用這一流水線,研究團隊成功生成了 23.7 萬條高質量、多樣化的指令微調樣本。在實驗評估中,使用這些資料微調後的 Qwen3-8B-Base 在 16 項基準測試中超越了 14 個領先基線,創下了該規模模型的最新紀錄,並且其效能非常接近官方 Qwen3-8B。值得注意的是,研究還發現模型在人類偏好和知識能力兩個維度上均獲得了提升,沒有出現此前常見的那種“效能蹺蹺板”現象,即一種能力提升以另一種能力下降為代價。此外,大規模實驗還充分證明了 HSS-Synth 的穩健性和可遷移性,表明該方法在不同設定和資料條件下都能保持有效。
該論文已於 2026 年 7 月 29 日提交至 arXiv 預印本平臺,編號為 2607.27379,並已被 ACL Findings 2026 會議接收。研究團隊已在 https://github.com/pengr/HSS-Synth 上公開了完整程式碼,以便研究社群復現實驗結果、驗證方法有效性並在此基礎上開展進一步研究。