擴散模型已成為現代視覺生成的主流正規化,顯著推動了文本到影像(T2I)與文本到影片(T2V)等多媒體內容合成任務的發展。為了進一步使生成模型與人類偏好對齊,強化學習(RL)作為一種後訓練策略展現出強大潛力。然而,現有的基於策略梯度的方法往往探索效率低下,容易陷入區域性最優,進而可能導致語義保真度和視覺真實感的下降。針對這些問題,研究者提出了一種名為“反思感知的GRPO”(Reflection-Aware GRPO,簡稱RA-GRPO)的新型強化學習偏好對齊框架,專門用於擴散生成模型。該框架的核心思想是在最佳化過程中引入“向後反思”來改進“向前生成”。具體而言,RA-GRPO首先引入了“擴散反思”(Diffusion Reflection)機制,透過使用一個弱估計器反轉擴散過程,對中間取樣軌跡進行矯正,將潛在狀態引導至真實資料流形中機率更高的區域。這一機制能夠在取樣過程中及時修正偏離方向的軌跡,從而緩解探索不足的問題。其次,框架提出了“反事實路徑合成”(Counterfactual Path Synthesis)方法,將矯正後的軌跡隱式地蒸餾到策略中,使模型能夠內化基於搜尋的探索所帶來的益處,而無需在推理時增加額外開銷。透過在T2I和T2V模型上進行的大量實驗,RA-GRPO在緩解獎勵駭客行為(reward hacking)以及提升泛化能力方面均顯著優於現有方法。值得注意的是,該方法與具體架構無關,可以無縫整合到標準擴散模型流程中,為穩定偏好對齊提供了一個極具前景的方向。該研究論文已提交至arXiv平臺,論文編號為2609.04282,作者包括Junlong Wu等共10位研究者,於2026年9月3日首次提交,屬於計算機視覺與模式識別(cs.CV)領域。研究團隊在摘要中詳細闡述了現有方法在探索效率上的不足:許多策略梯度方法僅依賴生成結果與人類偏好之間的獎勵訊號,卻忽略了生成過程中的中間狀態資訊,導致最佳化路徑缺乏引導。RA-GRPO的靈感類似於“以退為進”的策略——透過暫時性的“倒退”來修正潛在表示,使最終輸出更貼合真實資料分佈。擴散反思機制的關鍵在於,它利用一個較弱的估計器計算去噪過程中的誤差,並將誤差訊號用於調整取樣路徑,從而避免模型在低機率區域中盲目搜尋。反事實路徑合成則透過對比實際軌跡與矯正軌跡的差異,構建出虛擬的最優路徑,使策略在訓練階段就能學習到接近最優的探索行為。實驗部分,研究團隊在多個T2I和T2V基準上驗證了方法的有效性,結果顯示RA-GRPO在影像質量和語義一致性指標上均有提升,同時降低了獎勵駭客的發生頻率,即模型不再透過鑽取獎勵函式的漏洞來獲取高分。該方法有望為擴散模型的對齊訓練提供更穩定且可靠的解決方案。
退一步,進兩步:面向視覺生成的反思感知偏好最佳化
文章摘要
這項工作提出反思感知 GRPO(RA-GRPO),一種將“反向反思”引入前向生成的強化學習偏好對齊框架,用於擴散影像和影片生成。它透過擴散反轉修正中間取樣軌跡,並藉助反事實路徑合成將這些修正隱式蒸餾進策略,從而緩解獎勵駭客、提升泛化能力,且不需要改變模型架構或帶來推理開銷。
來源arXiv Computer Vision作者: Junlong Wu, Jiuzhou Lin, Jia Sun, Boheng Zhang, Huaiqing Wang, Dewen Fan, Houde Liu, Qianqian Gan, Fan Yang, Tingting Gao
退一步,進兩步:面向視覺生成的反思感知偏好最佳化