SDO:面向高效大模型后训练的结构感知数据组织
一篇新的 arXiv 论文提出 SDO,一种即插即用的数据组织框架,利用表示空间结构动态调整小批量组成与样本曝光,在 SFT、DPO 和 GRPO 中加速收敛、提升各题型准确率均衡性,且不会永久排除训练样本。
大语言模型的后训练阶段往往需要耗费大量计算资源,而现有的效率优化工作大多集中在两个方向:一是挑选信息量更大的训练样本,二是设计更合理的训练调度策略。相比之下,数据组织本身通常被看作一个静态的预处理环节。基于嵌入的分组方法会在训练开始之前就构造好固定的数据划分,但这些划分无法随着优化过程中样本曝光情况的变化而动态调整。其后果是,无论样本的实际优化需求如何,它们都会获得大致相同的曝光次数,于是有些样本不断产生冗余更新,另一些样本却始终没有得到充分优化。
针对这一缺陷,来自 arXiv 的新论文(编号 2607.27273,作者 Jinliang Gao 等 5 人)提出了 SDO(Structure-Aware Data Organization,结构感知数据组织),一种即插即用的数据组织框架。SDO 的核心思路是引入曝光驱动的反馈机制,根据表示空间中的结构来动态调整小批量的组成以及每个样本的曝光程度。框架在冻结的外部嵌入上按 epoch 运行,因此无需进行模型预热训练,避免了额外的计算开销。
在每个 epoch 内部,SDO 采用局部性感知的批处理策略,通过 KNN 邻域遍历构建语义连贯的小批量。这种做法的好处是,同一个批量内的样本在表示空间中彼此接近,更容易产生一致的梯度方向。在跨 epoch 层面,SDO 使用曝光均衡调度:它记录每个样本被选入批次的次数,并降低那些已经过度曝光样本的采样概率,从而在长期训练中保持对数据集的广泛覆盖。与静态分组方案不同,SDO 不会永久排除任何训练样本,只是动态调整它们的采样权重。
论文在三种主流后训练设置下验证了 SDO 的效果:监督微调(SFT)、直接偏好优化(DPO)和群体相对策略优化(GRPO)。实验结果表明,SDO 能够加速收敛,而且提升幅度在训练的早期到中期阶段最为显著。同时,SDO 产生的梯度更加连贯,不同问题类型之间的准确率也变得更加均衡。该论文共 9 页,包含 5 张图和 5 张表,于 2026 年 7 月 29 日提交至 arXiv 的 cs.LG 分类。这项工作提醒我们,数据组织方式本身也是影响训练效率的关键因素,值得在后续研究和工程实践中给予更多关注。