AI News HubLIVE
站內改寫2 分鐘閱讀

SDO:面向高效大模型後訓練的結構感知資料組織

一篇新的 arXiv 論文提出 SDO,一種即插即用的資料組織框架,利用表示空間結構動態調整小批次組成與樣本曝光,在 SFT、DPO 和 GRPO 中加速收斂、提升各題型準確率均衡性,且不會永久排除訓練樣本。

來源arXiv Machine Learning作者: Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu

大語言模型的後訓練階段往往需要耗費大量計算資源,而現有的效率最佳化工作大多集中在兩個方向:一是挑選資訊量更大的訓練樣本,二是設計更合理的訓練排程策略。相比之下,資料組織本身通常被看作一個靜態的預處理環節。基於嵌入的分組方法會在訓練開始之前就構造好固定的資料劃分,但這些劃分無法隨著最佳化過程中樣本曝光情況的變化而動態調整。其後果是,無論樣本的實際最佳化需求如何,它們都會獲得大致相同的曝光次數,於是有些樣本不斷產生冗餘更新,另一些樣本卻始終沒有得到充分最佳化。

針對這一缺陷,來自 arXiv 的新論文(編號 2607.27273,作者 Jinliang Gao 等 5 人)提出了 SDO(Structure-Aware Data Organization,結構感知資料組織),一種即插即用的資料組織框架。SDO 的核心思路是引入曝光碟機動的反饋機制,根據表示空間中的結構來動態調整小批次的組成以及每個樣本的曝光程度。框架在凍結的外部嵌入上按 epoch 執行,因此無需進行模型預熱訓練,避免了額外的計算開銷。

在每個 epoch 內部,SDO 採用區域性性感知的批處理策略,透過 KNN 鄰域遍歷構建語義連貫的小批次。這種做法的好處是,同一個批次內的樣本在表示空間中彼此接近,更容易產生一致的梯度方向。在跨 epoch 層面,SDO 使用曝光均衡排程:它記錄每個樣本被選入批次的次數,並降低那些已經過度曝光樣本的取樣機率,從而在長期訓練中保持對資料集的廣泛覆蓋。與靜態分組方案不同,SDO 不會永久排除任何訓練樣本,只是動態調整它們的取樣權重。

論文在三種主流後訓練設定下驗證了 SDO 的效果:監督微調(SFT)、直接偏好最佳化(DPO)和群體相對策略最佳化(GRPO)。實驗結果表明,SDO 能夠加速收斂,而且提升幅度在訓練的早期到中期階段最為顯著。同時,SDO 產生的梯度更加連貫,不同問題型別之間的準確率也變得更加均衡。該論文共 9 頁,包含 5 張圖和 5 張表,於 2026 年 7 月 29 日提交至 arXiv 的 cs.LG 分類。這項工作提醒我們,資料組織方式本身也是影響訓練效率的關鍵因素,值得在後續研究和工程實踐中給予更多關注。