SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練”
研究發現多模態大模型後訓練中SFT會導致分佈偏移,使模型效能下降,RL階段實際是在“還債”。PRISM提出三階段流水線,在SFT和RL之間加入分佈對齊階段,使用混合專家判別器分別處理感知漂移和推理漂移,顯著提升模型效能。
SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練” – 量子位
SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練”
衡宇 2026-05-17 11:42:11
來源:量子位
先把SFT挖的坑填了!
PRISM團隊 投稿
量子位 | 公眾號 QbitAI
SFT之後,直接上強化學習就夠了嗎?
小心,你做的可能不是“訓練”,而是“還債”。
在多模態大模型(MLLM)的後訓練中,行業內長期遵循著一個看似天經地義的正規化:先SFT,再RL,兩步到位。
從DeepSeek到Qwen,從GRPO到DAPO,大家拼命最佳化RL演算法的穩定性、取樣效率、獎勵設計……卻幾乎沒人回頭看一眼:
SFT到RL之間,是不是少了點什麼?
但來自香港科技大學(廣州)、南洋理工大學、清華大學等機構的最新研究Beyond SFT-to-RL(PRISM)給出了一個令人不安的發現:
SFT不僅沒有為RL鋪好路,反而在悄悄挖坑。
被忽視的“隱形斷層”:SFT到底做了什麼?
先看一組比較有意思的資料(7個主流多模態benchmark的平均準確率):
階段
Qwen3-VL-4B
Qwen3-VL-8B
原始Instruct模型
59.7%
63.3%
SFT之後
56.8% (-3.0)
58.1% (-5.2)
SFT → GRPO
61.8%
63.3%
可以看到,SFT之後,模型效能反而下降了。
8B 模型要更為明顯一點:SFT掉了5.2個點,辛辛苦苦做完強化學習,才剛剛爬回基線(baseline)的水平(63.3%→58.1%→63.3%)。
也就是說,你的RL可能一直在“還債”,而不是在“提升”。
而且這絕不是個例。
在當下主流的強Instruct模型上(Qwen3-VL等),只要SFT資料帶入一個與基座不一致的新分佈(比如目前最常見的GPT/Gemini蒸餾資料)幾乎都會觀察到類似的掉點。
原因很直接:這類基座已經經過大規模、精細的後訓練,能力本就處於一個相對穩定的高位。
SFT逼著模型去模仿一套新分佈,結果就是用一個更“窄”的分佈去覆蓋一個更“廣”的能力,舊能力被沖掉、新能力又沒真正學到。
換句話說,模型越強、越接近實際部署的水平,SFT引入的分佈偏移就越成為RL之前一道繞不開的“暗坑”。
這恰恰是PRISM必須存在的理由。
這背後的核心問題,是後訓練裡早已被反覆討論的分佈漂移(Distributional Drift)。
但在多模態場景下,它有一套更隱蔽、也更難治的表現形式。
問題根源:SFT引入的兩類偏差
SFT在多模態場景下,會引入兩類容易被忽視的偏差:
偏差一:表面模仿——token級loss把過程和結果同權處理
SFT的最佳化目標是在均勻的token級loss下模仿演示軌跡。
它不區分“過程”和“結果”:對模型來說,正確的推理步驟和格式化的模板套話,權重是一樣的。
結果就是模型學會了“長得像”正確答案,而不是“想得出”正確答案。 它學到的是表面模式,而非忠實的推理能力。
偏差二:感知漂移與推理漂移在同一個loss裡被混起來
這是多模態場景特有的麻煩。與純文本模型不同,多模態模型的漂移不是單一的,而是兩種定性不同的失敗模式在同時發生:
感知漂移:視覺定位出錯,模型“看錯了”
推理漂移:邏輯推導失敗,模型“想歪了”
這兩種漂移的成因不同、糾正方式不同,但SFT用同一個token loss把它們一起擬合。
而當RL階段時,模型已經在感知和推理兩端同時偏移,即一個“既看不準、又想不對”的模型。
現有RL演算法為什麼救不了?
從GRPO,到DAPO,再到GSPO,RL演算法這一段時間確實一直在進步。
但它們解決的是RL階段內部的問題:取樣效率、梯度方差、策略崩潰。沒有任何一個RL演算法回頭去修復SFT留下的分佈偏差。
這裡舉個不太恰當的例子:這裡就好比你參加百米短跑,SFT不僅沒有讓你往前走,反而把你向後推了50米。
現有的RL演算法都在研究怎麼跑得更快,但起點還在坑裡,而PRISM要做的,就是在SFT和RL之間補上這一步,不僅把你拉回起跑線,還順勢往前推一把,讓RL只用跑50米就能衝線。
PRISM的核心方案:三階段流水線(Pipeline)
PRISM打破了傳統的兩階段正規化,提出了SFT → 分佈對齊 (PRISM) → RLVR的三階段流水線。
關鍵創新在於中間的分佈對齊階段。
混合專家判別器(MoE Discriminator)
感知漂移和推理漂移是兩類成因不同的偏差,需要分開處理。
PRISM為此設計了一個混合專家判別器,由兩個專門化的專家組成:
感知專家D_v:專門評估視覺描述,測量模型的輸出是否忠實於影像內容,解決感知漂移
推理專家D_r:專門評估推理軌跡,測量邏輯推導是否一致有效,解決推理漂移
最終判別得分為兩者的加權組合:
r(x,y) = α · D_v(x,c) + (1-α) · D_r(x,t)
這種設計的好處是提供解耦的糾正訊號,避免將兩種完全不同的誤差模式塞進一個標量裡,導致梯度訊號變得嘈雜。
黑盒蒸餾:不需要教師logits
PRISM的另一個優雅之處在於:它是黑盒的。
很多蒸餾方法需要訪問教師模型的logits(內部機率分佈),這意味著你得有教師模型的完整權重。
但在實際場景中,最強的模型往往只提供API,你只能看到輸出,看不到內部狀態。
PRISM完全在響應級別工作:從強模型(Gemini 3 Flash)採集高質量輸出作為正樣本,從當前策略取樣作為負樣本,透過對抗博弈來對齊分佈。
只要能調API,就能用PRISM。
一個重要的設計決策:去掉KL正則化
傳統RL訓練通常會加一個KL散度約束,防止策略偏離初始模型太遠。但PRISM有意識地去掉了這個約束。
道理很簡單,對齊階段的目的,就是糾正SFT帶來的分佈偏差。再加一個把策略拉回SFT分佈的KL約束,本身就和這個目標相互矛盾。
分佈演變:對齊真的把模型拉回到更好的起始點
下圖直觀地展示了分佈的演變過程:從Base到Post-SFT再到Post-Alignment,無論是推理步數還是視覺描述項數的分佈,都在逐步向監督資料靠攏:
可以清晰看到:Post-SFT(藍線)與Supervision(黑線)仍有明顯偏差,而Post-Alignment(橙線)則大幅縮小了這一差距,且這種改進在Post-RLVR(綠線)階段得以保持。
實驗驗證
在Qwen3-VL的4B和8B兩個規模上,PRISM搭配GRPO/DAPO/GSPO三種主流RL演算法,在4個數學推理基準(MathVista、MathVerse、MathVision、WeMath)和3個通用多模態基準(MMMU、MMMU-Pro、HallusionBench)上全面驗證了有效性。
下表是論文Table 1的主結果(灰色行為PRISM):
從主表裡能讀出幾個值得展開的訊號:
(1)模型越強,PRISM的增益越大:8B拿到+6.0的平均提升,4B為+4.4,更強的基座被SFT“傷害”得更深,也因此從對齊中受益更多;
(2)PRISM在絕大多數子基準上拿到了同基座下的最佳分數(表中加粗),覆蓋數學推理與通用視覺理解兩類任務,這意味著對齊帶來的不是某個領域的區域性增益,而是分佈層面的全域性校準。
消融實驗:每一步都不可或缺
從消融表(論文Table 2)裡能直接讀出每個元件的貢獻:
(1) 去掉SFT階段直接掉16.8個點,說明SFT作為“冷啟動”仍不可替代,PRISM不是要取代SFT,而是修復它帶來的副作用;
(2)去掉對齊階段掉4.4個點,與4B主表的提升幅度完全對應,是分佈對齊效果的直接證據;
(3)單個4B判別器替代MoE掉3.4,僅文本判別器掉3.9。
後者尤為有趣:沒有視覺感知的判別器只能捕捉表面模式(格式、模板、風格),導致策略學會了“鸚鵡學舌式對齊”,聽起來像監督資料,但實際上看不到所描述的內容。
結語
PRISM的出現,給多模態大模型的後訓練正規化打上了一個“補丁”,但這個補丁可能比主程式還重要。
SFT 和RL之間不是無縫銜接,而是存在一道被長期忽略的分佈斷層。RL演算法再強,如果起點就歪了,跑得越快只會偏得越遠。
讓多模態大模型在推理任務上再進一步,未必要靠更復雜的RL演算法或更多訓練資料。
把SFT和RL之間這一步對齊補上,模型自然會跑得更穩。
Arxiv:https://arxiv.org/abs/2604.28123
Github:https://github.com/XIAO4579/PRISM
合作詳詢:[email protected]
版權所有,未經授權不得以任何形式轉載及使用,違者必究。
SFT 多模態大模型 模型訓練
衡宇
6.4k Stars!用Claude Code寫論文的全套流水線,有人打包開源了2026-05-17
數億元融資落地!國內最早佈局“人類學習”路線的具身公司,用人類視角重做具身智慧2026-05-15
奧特曼趁馬斯克出差爆猛料:他曾想讓子女繼承OpenAI2026-05-13
Token需求狂飆千倍,22億熱錢湧向這家AGI Infra頭號玩家2026-05-07
相關閱讀
AI搞定谷歌驗證碼,最新多模態大模型比GPT-4V空間理解更準確 | 蘋果AI/ML團隊
全華人團隊陣容
明敏2023-10-12
多模態大模型 蘋果AI/ML
天工大模型登頂多模態榜單!解決幻覺、跨語言兩大難題
崑崙萬維最近在大模型圈“風生水起”
豐色2023-09-06
多模態大模型
全球四項第一!優必選自研人形機器人最強大腦Thinker登頂全球
人形機器人Walker S系列的“最強大腦”實現關鍵進化
量子位2025-09-09
優必選 具身智慧 多模態大模型
多模態能力全球TOP3,來自中國從容大模型
曾重新整理10項世界紀錄
白交2024-07-02
雲從 從容大模型 多模態大模型
北大王選所:讓多模態大模型更懂人類在做什麼|ECCV 2024
靠提示詞就行
一水2024-08-13
北大 多模態大模型
北大機器人當上亞運志願者,全靠學生把多模態大模型結合具身智慧
論機器人想在杭州當志願者有多拼
衡宇2023-10-18
具身智慧 北大 多模態大模型
熱門文章
浙大校友用AI突破32年拉姆齊數下界
2026-05-10
做AI漫劇的、搞Agent的、投矽谷的,5.20這些賽道頂流碰頭了|最新嘉賓陣容
2026-05-11
AI步入“自我進化”時代,李彥宏首提AI時代度量衡“DAA”|Create2026百度AI開發者⼤會速覽
2026-05-13
矽谷刷屏的AI護城河新論:程式碼能抄,產品能抄,但有一樣東西,誰都抄不走
2026-05-11
浙大推出讓AI會「導演」的角色扮演框架!四通道訊息沉浸式互動
2026-05-11
掃碼關注量子位
量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1