最新のInterconnectsポッドキャストでは、Nathan LambertがAI2の研究者Finbarr Timbersを迎え、ポストトレーニングレシピの変遷を徹底的に議論しました。LambertはRLHF/ポストトレーニング本の執筆を締めくくるにあたり、InstructGPTから2026年のフロンティアモデルに至る主要なレシピをまとめたスライドデッキを用意。この対談は、歴史的な流れを把握するだけでなく、現在のフロンティアラボが採用する最新戦略——マルチティーチャーオン・ポリシー蒸留(MOPD)——にまで踏み込んでいます。
ポストトレーニングレシピは過去1年で劇的な変化を遂げています。2022-2023年のInstructGPTはSFT→報酬モデル→RLという古典的な3ステップを確立。2024年のLlama 3やTülu 3はSFT→DPO→検証可能報酬RL(RLVR)を標準化しました。2025年のDeepSeek R1は大規模RLを中核に据え、2026年のMiMo Flash v2とDeepSeek V4はMOPDという新パラダイムを導入しました。
MOPDの中核は、各ドメインの専門教師(それぞれSFT+ドメイン固有RL)を訓練し、汎用学生モデルが自身の軌跡をサンプリングして各トークンで教師分布との逆KLを最小化する点にあります。このアプローチが生まれた理由は、RLが高コストで矛盾を起こしやすい(数学とコードのRLが互いにトレードオフ)一方、専門家は安価で並列開発可能だからです。LambertとTimbersは、MOPDの登場によりポストトレーニングが単一モデル訓練から専門家協調と知識蒸留へと進化したと指摘します。
彼らはまた、OLMo-3のポストトレーニングプロセスを振り返りました。OLMo-3は推論モデルとして2025年11月にリリースされ、DeepSeek R1から約9ヶ月遅れでしたが、Tülu 3由来の簡潔なレシピ(SFT→DPO→RLVR)は学術組織としては立派な成果でした。Lambertは、現代のポストトレーニングのボトルネックは組織調整能力だと強調。Timbersは、9ヶ月のターンアラウンドタイムはモデル開発として決して悪くなく、特に既存のレシピに推論能力を移植したアプローチを考慮すれば妥当だと述べています。
さらに、2026年の代表的なレシピとして、MiMo Flash v2の6専門家MOPD、Nemotron 3 Ultraの2ラウンド10専門家蒸留、MAI-Thinking-1の多段階RLなどが議論されました。これらのレシピは、ポストトレーニングの急速な進化——単一パイプラインから専門家協調、多段階蒸留へ——を物語っています。LambertとTimbersは、LLM分野に参入する際には、複数の能力目標をバランスする技術の進化に注目すべきだとアドバイスしています。完全版はApple Podcasts、Spotifyなどで配信中です。