AI News HubLIVE
サイト内リライト2 分で読了

SDO:効率的なLLMポストトレーニングのための構造認識型データ整理

新しいarXiv論文は、表現空間の構造を利用してミニバッチ構成とサンプル露出を適応的に調整するプラグアンドプレイ型データ整理フレームワークSDOを提案。SFT・DPO・GRPOで収束を加速し、質問タイプ間の精度バランスを向上させつつ、サンプルを恒久的に除外しない。

ソースarXiv Machine Learning著者: Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu

大規模言語モデル(LLM)のポストトレーニングは非常にコストがかかる。既存の効率化手法は主に、情報量の多いサンプルの選択やトレーニングスケジュールの設計に焦点を当ててきた。しかし、データ整理そのものは通常、静的な前処理ステップとして扱われている。埋め込みベースのグループ化手法はトレーニング前に固定の分割を構築するため、最適化の進行に伴って変化するサンプル露出に適応できない。その結果、最適化のニーズが異なるにもかかわらず、すべてのサンプルが同様に露出され、一部のサンプルでは冗長な更新が発生し、別のサンプルは最適化不足のまま残される。

この問題に取り組むため、arXivに投稿された新しい論文(番号2607.27273、著者はJinliang Gao氏ら5名)は、SDO(Structure-Aware Data Organization)を提案している。SDOは、露出駆動型フィードバック機構を備えたプラグアンドプレイ型のデータ整理フレームワークであり、表現空間の構造に基づいてミニバッチの構成とサンプル露出を調整する。凍結された外部埋め込み上でエポックごとに動作するため、モデルのウォームアップトレーニングによるオーバーヘッドを回避できる。

各エポック内では、局所性を考慮したバッチ処理により、KNN近傍探索を通じて意味的に一貫したミニバッチが形成される。これにより、同じバッチ内のサンプルは表現空間上で互いに近く、より一貫性のある勾配が得られやすい。エポック間では、露出バランス調整スケジューリングがサンプルごとの参加回数を記録し、過度に露出されたサンプルのサンプリング確率を下げることで、長期的なデータカバレッジを維持する。静的なグループ化とは異なり、SDOはトレーニングサンプルを恒久的に除外しない。

論文は、SFT(教師あり微調整)、DPO(直接選好最適化)、GRPO(グループ相対方策最適化)の3つのポストトレーニング設定で評価を行った。実験結果によると、SDOは収束を加速し、特にトレーニング初期から中期にかけて最大の改善が見られた。また、より一貫性のある勾配を生成し、質問タイプ間での精度バランスも向上した。論文は全9ページ、図5点、表5点で構成され、2026年7月29日にarXivのcs.LGカテゴリへ投稿された。