跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

前沿後訓練配方回顧:與Finbarr Timbers對話

文章摘要

本播客深入探討了後訓練配方的演變,從InstructGPT到2026年的多教師策略(MOPD)。Nathan Lambert與Finbarr Timbers回顧了OLMo-3等開源模型的挑戰,並分析了前沿實驗室如何透過專業化教師和策略蒸餾來突破效能瓶頸。

來源Interconnects (Nathan Lambert)作者: Nathan Lambert
前沿後訓練配方回顧:與Finbarr Timbers對話
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在最新一期Interconnects播客中,Nathan Lambert與AI2研究員Finbarr Timbers進行了一場深度對話,系統回顧了後訓練配方的演變歷程。作為RLHF/後訓練書籍的收尾工作,Lambert精心準備了一份幻燈片,梳理了從InstructGPT到2026年前沿模型的關鍵配方變化。這場對話不僅涵蓋了歷史脈絡,還深入剖析了當前前沿實驗室採用的最新策略——多教師線上策略蒸餾(MOPD)。

後訓練配方在過去一年經歷了前所未有的變革。2022-2023年,InstructGPT確立了SFT→獎勵模型→RL的經典三步流程。2024年,Llama 3和Tülu 3等開源模型將流程具體化為SFT→DPO→可驗證獎勵強化學習(RLVR)。2025年DeepSeek R1的釋出使大規模強化學習成為核心,而2026年的MiMo Flash v2和DeepSeek V4則引入了MOPD這一全新正規化。

MOPD的核心思想是:為每個領域訓練專業教師,每個教師經歷SFT和領域專用RL,然後使用一個通用學生模型透過取樣自身軌跡來學習,在每個token上最小化與相應教師輸出分佈的反向KL散度。這種方法的優勢在於:RL訓練成本高昂且容易出現衝突(例如數學和程式碼能力相互制約),而專門化教師既經濟又易於並行開發。Lambert和Timbers指出,MOPD的出現標誌著後訓練從單一模型訓練轉向專業化協作和知識蒸餾。

他們還回顧了OLMo-3的後訓練過程。OLMo-3作為推理模型於2025年11月釋出,距DeepSeek R1約9個月,其簡潔的配方(基於Tülu 3的SFT→DPO→RLVR)在學術組織中已屬不易。Lambert強調,現代後訓練的瓶頸在於組織協調能力——複雜的管線需要有效管理計算和資料流。Timbers補充道,雖然OLMo-3釋出較晚,但9個月的週轉時間在模型開發中並不算差,尤其考慮到他們是在現有配方基礎上移植推理能力,而非從頭重建R1的配方。

播客中還詳細討論了2026年的典型配方,例如MiMo Flash v2的六專家MOPD、Nemotron 3 Ultra的兩輪十專家蒸餾,以及MAI-Thinking-1的多階段RL。這些配方展示了後訓練領域的快速演進:從前端的單管線到後端的專業化教師協作,再到多輪蒸餾的成熟應用。Lambert和Timbers一致認為,對於希望進入LLM領域的從業者,關注後訓練技術的演進——特別是如何平衡多個能力目標——將是關鍵。完整播客可在Apple Podcasts、Spotify等平臺收聽。

展開要點與分析

文章情報

工程師進階

要點

  • 後訓練配方在過去一年發生了鉅變,從單一管線走向多教師策略(MOPD)。
  • MOPD透過訓練多個領域專家教師,再蒸餾到一個通用學生模型中,解決了RL衝突問題。
  • 開源模型如OLMo-3雖然晚於DeepSeek R1,但在後訓練方面受限於組織能力。
  • 2026年的配方(如MiMo Flash v2、DeepSeek V4)展示了多階段RL和蒸餾的成熟應用。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。