本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

フロンティアポストトレーニングレシピレビュー:Finbarr Timbersとの対談

記事の要約

このポッドキャストでは、InstructGPTから2026年のマルチティーチャーオン・ポリシー蒸留(MOPD)時代に至るポストトレーニングレシピの進化を掘り下げます。Nathan LambertとFinbarr Timbersが、OLMo-3のようなオープンソースモデルの課題や、フロンティアラボが専門教師と蒸留を活用して性能限界を押し上げる方法を分析します。

ソースInterconnects (Nathan Lambert)著者: Nathan Lambert
フロンティアポストトレーニングレシピレビュー:Finbarr Timbersとの対談
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

最新のInterconnectsポッドキャストでは、Nathan LambertがAI2の研究者Finbarr Timbersを迎え、ポストトレーニングレシピの変遷を徹底的に議論しました。LambertはRLHF/ポストトレーニング本の執筆を締めくくるにあたり、InstructGPTから2026年のフロンティアモデルに至る主要なレシピをまとめたスライドデッキを用意。この対談は、歴史的な流れを把握するだけでなく、現在のフロンティアラボが採用する最新戦略——マルチティーチャーオン・ポリシー蒸留(MOPD)——にまで踏み込んでいます。

ポストトレーニングレシピは過去1年で劇的な変化を遂げています。2022-2023年のInstructGPTはSFT→報酬モデル→RLという古典的な3ステップを確立。2024年のLlama 3やTülu 3はSFT→DPO→検証可能報酬RL(RLVR)を標準化しました。2025年のDeepSeek R1は大規模RLを中核に据え、2026年のMiMo Flash v2とDeepSeek V4はMOPDという新パラダイムを導入しました。

MOPDの中核は、各ドメインの専門教師(それぞれSFT+ドメイン固有RL)を訓練し、汎用学生モデルが自身の軌跡をサンプリングして各トークンで教師分布との逆KLを最小化する点にあります。このアプローチが生まれた理由は、RLが高コストで矛盾を起こしやすい(数学とコードのRLが互いにトレードオフ)一方、専門家は安価で並列開発可能だからです。LambertとTimbersは、MOPDの登場によりポストトレーニングが単一モデル訓練から専門家協調と知識蒸留へと進化したと指摘します。

彼らはまた、OLMo-3のポストトレーニングプロセスを振り返りました。OLMo-3は推論モデルとして2025年11月にリリースされ、DeepSeek R1から約9ヶ月遅れでしたが、Tülu 3由来の簡潔なレシピ(SFT→DPO→RLVR)は学術組織としては立派な成果でした。Lambertは、現代のポストトレーニングのボトルネックは組織調整能力だと強調。Timbersは、9ヶ月のターンアラウンドタイムはモデル開発として決して悪くなく、特に既存のレシピに推論能力を移植したアプローチを考慮すれば妥当だと述べています。

さらに、2026年の代表的なレシピとして、MiMo Flash v2の6専門家MOPD、Nemotron 3 Ultraの2ラウンド10専門家蒸留、MAI-Thinking-1の多段階RLなどが議論されました。これらのレシピは、ポストトレーニングの急速な進化——単一パイプラインから専門家協調、多段階蒸留へ——を物語っています。LambertとTimbersは、LLM分野に参入する際には、複数の能力目標をバランスする技術の進化に注目すべきだとアドバイスしています。完全版はApple Podcasts、Spotifyなどで配信中です。

要点と分析を開く

記事インテリジェンス

エンジニア中級

要点

  • ポストトレーニングレシピは大きく変化し、単一パイプラインからマルチティーチャー戦略(MOPD)へ移行した。
  • MOPDはドメイン専門教師を訓練し、一般学生モデルに蒸留することでRLの競合問題を解決する。
  • OLMo-3のようなオープンモデルはDeepSeek R1より遅れたが、組織能力の限界を示している。
  • 2026年のレシピ(例:MiMo Flash v2、DeepSeek V4)は成熟した多段階RLと蒸留を示している。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。