AI News HubLIVE
サイト内リライト2 分で読了

シーケンス知識 #898: トレースが教師:推論を小モデルに蒸留する

2025年1月、DeepSeekはその大規模推論モデルR1を用いて約80万の完全な解答プロセス(長い思考連鎖、誤った開始、自己訂正などを含む)を生成し、フィルタリング後にQwenやLlamaなどの小型オープンモデルに対して単純な教師ありファインチューニングを行い、強化学習なしで小モデルがそのサイズを超えた推論能力を示すことを発見した。これは、シーケンスレベルの模倣が推論蒸留に適さないという従来の見解に挑戦するものである。

ソースTheSequence著者: Jesus Rodriguez

2025年1月、DeepSeekは注目すべき研究成果を発表した。同社は大規模推論モデルDeepSeek R1を使用して、約80万の完全な解答プロセスを生成した。これらのプロセスは、誤った開始、自己訂正、時折の「ちょっと待って、考え直そう」といったステップを含む長く入り組んだ思考連鎖である。正しく読みやすいトレースをフィルタリングした後、DeepSeekチームは最もシンプルなアプローチを採用した:これらのトレースを使った単純な教師ありファインチューニングである。彼らは、1.5B、7B、14B、32BパラメータのQwenシリーズ、および8Bと70BのLlamaシリーズなど、既存のオープンモデルを選択した。注目すべきは、強化学習、逆KLダイバージェンス、オン・ポリシーサンプリング、教師としての批評家などは一切使用せず、教師モデルの出力に対する単純な次単語予測訓練のみを行ったことである。

結果は驚くべきものだった。蒸留された32Bモデルは、本来解決できないはずの競技数学の問題を解き始めた。7Bモデルは自らの推論を検証し、推論の途中で分岐するという創発的な振る舞いを示した。これらの小型密集モデルは、突如として10倍の規模のモデルに匹敵する推論能力を獲得した。

この結果は、推論蒸留に関する従来の理論と矛盾するように見える。本シリーズでは、フォワードKLからリバースKLへの困難な移行を詳細に論じ、教師の軌跡を単純に模倣することはできないと主張してきた。なぜなら、学生モデルは推論時に決して教師の分布上に存在しないからである。そのため、この10年で最も重要な推論蒸留の成果が単純なシーケンスレベルの模倣であると聞けば、多くの人は戸惑うだろう。

しかし、その答えは「模倣が有効」か「模倣が無効」かという単純なものではない。鍵となるのは「答え」ではなく「トレース」である。教師モデルが生成する完全な推論連鎖は、最終的な答えよりもはるかに豊かな信号を提供する。問題解決のプロセス、自己訂正のパターン、論理的な展開経路などが含まれている。学生モデルはこれらのトレースを学習することで、単なる出力結果ではなく、思考の仕方そのものを学ぶのである。また、学生モデルは推論中に教師の分布から逸脱する可能性があるが、大規模で多様なトレースデータにより、効果的に一般化することができる。

この研究は、推論蒸留の実践方法を再定義するだけでなく、AI分野において最もシンプルな手法が時に最も驚くべきブレークスルーをもたらすことを示している。研究者にとっては、複雑なアルゴリズムを追求する前に、データが豊富な単純なベースラインが既に強力である可能性があることを意味する。アプリケーション開発者にとっては、大規模モデルの能力を小型で効率的なデプロイメントモデルに容易に移行できることを示唆している。

結論として、DeepSeek R1の蒸留実験は「トレースが教師である」という考え方の威力を証明し、将来のより効率的で小型の推論モデルへの道を切り開いた。