AI News HubLIVE
站內改寫5 分鐘閱讀

SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練”

研究發現多模態大模型後訓練中SFT會導致分佈偏移,使模型效能下降,RL階段實際是在“還債”。PRISM提出三階段流水線,在SFT和RL之間加入分佈對齊階段,使用混合專家判別器分別處理感知漂移和推理漂移,顯著提升模型效能。

來源量子位作者: 衡宇

SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練” – 量子位

SFT別急著接RL!你的多模態大模型可能一直在“帶傷訓練”

衡宇 2026-05-17 11:42:11

來源:量子位

先把SFT挖的坑填了!

PRISM團隊 投稿

量子位 | 公眾號 QbitAI

SFT之後,直接上強化學習就夠了嗎?

小心,你做的可能不是“訓練”,而是“還債”。

在多模態大模型(MLLM)的後訓練中,行業內長期遵循著一個看似天經地義的正規化:先SFT,再RL,兩步到位。

從DeepSeek到Qwen,從GRPO到DAPO,大家拼命最佳化RL演算法的穩定性、取樣效率、獎勵設計……卻幾乎沒人回頭看一眼:

SFT到RL之間,是不是少了點什麼?

但來自香港科技大學(廣州)、南洋理工大學、清華大學等機構的最新研究Beyond SFT-to-RL(PRISM)給出了一個令人不安的發現:

SFT不僅沒有為RL鋪好路,反而在悄悄挖坑。

被忽視的“隱形斷層”:SFT到底做了什麼?

先看一組比較有意思的資料(7個主流多模態benchmark的平均準確率):

階段

Qwen3-VL-4B

Qwen3-VL-8B

原始Instruct模型

59.7%

63.3%

SFT之後

56.8% (-3.0)

58.1% (-5.2)

SFT → GRPO

61.8%

63.3%

可以看到,SFT之後,模型效能反而下降了。

8B 模型要更為明顯一點:SFT掉了5.2個點,辛辛苦苦做完強化學習,才剛剛爬回基線(baseline)的水平(63.3%→58.1%→63.3%)。

也就是說,你的RL可能一直在“還債”,而不是在“提升”。

而且這絕不是個例。

在當下主流的強Instruct模型上(Qwen3-VL等),只要SFT資料帶入一個與基座不一致的新分佈(比如目前最常見的GPT/Gemini蒸餾資料)幾乎都會觀察到類似的掉點。

原因很直接:這類基座已經經過大規模、精細的後訓練,能力本就處於一個相對穩定的高位。

SFT逼著模型去模仿一套新分佈,結果就是用一個更“窄”的分佈去覆蓋一個更“廣”的能力,舊能力被沖掉、新能力又沒真正學到。

換句話說,模型越強、越接近實際部署的水平,SFT引入的分佈偏移就越成為RL之前一道繞不開的“暗坑”。

這恰恰是PRISM必須存在的理由。

這背後的核心問題,是後訓練裡早已被反覆討論的分佈漂移(Distributional Drift)。

但在多模態場景下,它有一套更隱蔽、也更難治的表現形式。

問題根源:SFT引入的兩類偏差

SFT在多模態場景下,會引入兩類容易被忽視的偏差:

偏差一:表面模仿——token級loss把過程和結果同權處理

SFT的最佳化目標是在均勻的token級loss下模仿演示軌跡。

它不區分“過程”和“結果”:對模型來說,正確的推理步驟和格式化的模板套話,權重是一樣的。

結果就是模型學會了“長得像”正確答案,而不是“想得出”正確答案。 它學到的是表面模式,而非忠實的推理能力。

偏差二:感知漂移與推理漂移在同一個loss裡被混起來

這是多模態場景特有的麻煩。與純文本模型不同,多模態模型的漂移不是單一的,而是兩種定性不同的失敗模式在同時發生:

感知漂移:視覺定位出錯,模型“看錯了”

推理漂移:邏輯推導失敗,模型“想歪了”

這兩種漂移的成因不同、糾正方式不同,但SFT用同一個token loss把它們一起擬合。

而當RL階段時,模型已經在感知和推理兩端同時偏移,即一個“既看不準、又想不對”的模型。

現有RL演算法為什麼救不了?

從GRPO,到DAPO,再到GSPO,RL演算法這一段時間確實一直在進步。

但它們解決的是RL階段內部的問題:取樣效率、梯度方差、策略崩潰。沒有任何一個RL演算法回頭去修復SFT留下的分佈偏差。

這裡舉個不太恰當的例子:這裡就好比你參加百米短跑,SFT不僅沒有讓你往前走,反而把你向後推了50米。

現有的RL演算法都在研究怎麼跑得更快,但起點還在坑裡,而PRISM要做的,就是在SFT和RL之間補上這一步,不僅把你拉回起跑線,還順勢往前推一把,讓RL只用跑50米就能衝線。

PRISM的核心方案:三階段流水線(Pipeline)

PRISM打破了傳統的兩階段正規化,提出了SFT → 分佈對齊 (PRISM) → RLVR的三階段流水線。

關鍵創新在於中間的分佈對齊階段。

混合專家判別器(MoE Discriminator)

感知漂移和推理漂移是兩類成因不同的偏差,需要分開處理。

PRISM為此設計了一個混合專家判別器,由兩個專門化的專家組成:

感知專家D_v:專門評估視覺描述,測量模型的輸出是否忠實於影像內容,解決感知漂移

推理專家D_r:專門評估推理軌跡,測量邏輯推導是否一致有效,解決推理漂移

最終判別得分為兩者的加權組合:

r(x,y) = α · D_v(x,c) + (1-α) · D_r(x,t)

這種設計的好處是提供解耦的糾正訊號,避免將兩種完全不同的誤差模式塞進一個標量裡,導致梯度訊號變得嘈雜。

黑盒蒸餾:不需要教師logits

PRISM的另一個優雅之處在於:它是黑盒的。

很多蒸餾方法需要訪問教師模型的logits(內部機率分佈),這意味著你得有教師模型的完整權重。

但在實際場景中,最強的模型往往只提供API,你只能看到輸出,看不到內部狀態。

PRISM完全在響應級別工作:從強模型(Gemini 3 Flash)採集高質量輸出作為正樣本,從當前策略取樣作為負樣本,透過對抗博弈來對齊分佈。

只要能調API,就能用PRISM。

一個重要的設計決策:去掉KL正則化

傳統RL訓練通常會加一個KL散度約束,防止策略偏離初始模型太遠。但PRISM有意識地去掉了這個約束。

道理很簡單,對齊階段的目的,就是糾正SFT帶來的分佈偏差。再加一個把策略拉回SFT分佈的KL約束,本身就和這個目標相互矛盾。

分佈演變:對齊真的把模型拉回到更好的起始點

下圖直觀地展示了分佈的演變過程:從Base到Post-SFT再到Post-Alignment,無論是推理步數還是視覺描述項數的分佈,都在逐步向監督資料靠攏:

可以清晰看到:Post-SFT(藍線)與Supervision(黑線)仍有明顯偏差,而Post-Alignment(橙線)則大幅縮小了這一差距,且這種改進在Post-RLVR(綠線)階段得以保持。

實驗驗證

在Qwen3-VL的4B和8B兩個規模上,PRISM搭配GRPO/DAPO/GSPO三種主流RL演算法,在4個數學推理基準(MathVista、MathVerse、MathVision、WeMath)和3個通用多模態基準(MMMU、MMMU-Pro、HallusionBench)上全面驗證了有效性。

下表是論文Table 1的主結果(灰色行為PRISM):

從主表裡能讀出幾個值得展開的訊號:

(1)模型越強,PRISM的增益越大:8B拿到+6.0的平均提升,4B為+4.4,更強的基座被SFT“傷害”得更深,也因此從對齊中受益更多;

(2)PRISM在絕大多數子基準上拿到了同基座下的最佳分數(表中加粗),覆蓋數學推理與通用視覺理解兩類任務,這意味著對齊帶來的不是某個領域的區域性增益,而是分佈層面的全域性校準。

消融實驗:每一步都不可或缺

從消融表(論文Table 2)裡能直接讀出每個元件的貢獻:

(1) 去掉SFT階段直接掉16.8個點,說明SFT作為“冷啟動”仍不可替代,PRISM不是要取代SFT,而是修復它帶來的副作用;

(2)去掉對齊階段掉4.4個點,與4B主表的提升幅度完全對應,是分佈對齊效果的直接證據;

(3)單個4B判別器替代MoE掉3.4,僅文本判別器掉3.9。

後者尤為有趣:沒有視覺感知的判別器只能捕捉表面模式(格式、模板、風格),導致策略學會了“鸚鵡學舌式對齊”,聽起來像監督資料,但實際上看不到所描述的內容。

結語

PRISM的出現,給多模態大模型的後訓練正規化打上了一個“補丁”,但這個補丁可能比主程式還重要。

SFT 和RL之間不是無縫銜接,而是存在一道被長期忽略的分佈斷層。RL演算法再強,如果起點就歪了,跑得越快只會偏得越遠。

讓多模態大模型在推理任務上再進一步,未必要靠更復雜的RL演算法或更多訓練資料。

把SFT和RL之間這一步對齊補上,模型自然會跑得更穩。

Arxiv:https://arxiv.org/abs/2604.28123

Github:https://github.com/XIAO4579/PRISM

合作詳詢:[email protected]

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

SFT 多模態大模型 模型訓練

衡宇

6.4k Stars!用Claude Code寫論文的全套流水線,有人打包開源了2026-05-17

數億元融資落地!國內最早佈局“人類學習”路線的具身公司,用人類視角重做具身智慧2026-05-15

奧特曼趁馬斯克出差爆猛料:他曾想讓子女繼承OpenAI2026-05-13

Token需求狂飆千倍,22億熱錢湧向這家AGI Infra頭號玩家2026-05-07

相關閱讀

AI搞定谷歌驗證碼,最新多模態大模型比GPT-4V空間理解更準確 | 蘋果AI/ML團隊

全華人團隊陣容

明敏2023-10-12

多模態大模型 蘋果AI/ML

天工大模型登頂多模態榜單!解決幻覺、跨語言兩大難題

崑崙萬維最近在大模型圈“風生水起”

豐色2023-09-06

多模態大模型

全球四項第一!優必選自研人形機器人最強大腦Thinker登頂全球

人形機器人Walker S系列的“最強大腦”實現關鍵進化

量子位2025-09-09

優必選 具身智慧 多模態大模型

多模態能力全球TOP3,來自中國從容大模型

曾重新整理10項世界紀錄

白交2024-07-02

雲從 從容大模型 多模態大模型

北大王選所:讓多模態大模型更懂人類在做什麼|ECCV 2024

靠提示詞就行

一水2024-08-13

北大 多模態大模型

北大機器人當上亞運志願者,全靠學生把多模態大模型結合具身智慧

論機器人想在杭州當志願者有多拼

衡宇2023-10-18

具身智慧 北大 多模態大模型

熱門文章

浙大校友用AI突破32年拉姆齊數下界

2026-05-10

做AI漫劇的、搞Agent的、投矽谷的,5.20這些賽道頂流碰頭了|最新嘉賓陣容

2026-05-11

AI步入“自我進化”時代,李彥宏首提AI時代度量衡“DAA”|Create2026百度AI開發者⼤會速覽

2026-05-13

矽谷刷屏的AI護城河新論:程式碼能抄,產品能抄,但有一樣東西,誰都抄不走

2026-05-11

浙大推出讓AI會「導演」的角色扮演框架!四通道訊息沉浸式互動

2026-05-11

掃碼關注量子位

量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1