跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

退一步,進兩步:面向視覺生成的反思感知偏好優化

文章摘要

這項工作提出反思感知 GRPO(RA-GRPO),一種將“反向反思”引入前向生成的強化學習偏好對齊框架,用於擴散圖像和視頻生成。它通過擴散反轉修正中間採樣軌跡,並藉助反事實路徑合成將這些修正隱式蒸餾進策略,從而緩解獎勵黑客、提升泛化能力,且不需要改變模型架構或帶來推理開銷。

來源arXiv Computer Vision作者: Junlong Wu, Jiuzhou Lin, Jia Sun, Boheng Zhang, Huaiqing Wang, Dewen Fan, Houde Liu, Qianqian Gan, Fan Yang, Tingting Gao
退一步,進兩步:面向視覺生成的反思感知偏好優化
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

擴散模型已成為現代視覺生成的主流範式,顯著推動了文本到圖像(T2I)與文本到視頻(T2V)等多媒體內容合成任務的發展。為了進一步使生成模型與人類偏好對齊,強化學習(RL)作為一種後訓練策略展現出強大潛力。然而,現有的基於策略梯度的方法往往探索效率低下,容易陷入局部最優,進而可能導致語義保真度和視覺真實感的下降。針對這些問題,研究者提出了一種名為“反思感知的GRPO”(Reflection-Aware GRPO,簡稱RA-GRPO)的新型強化學習偏好對齊框架,專門用於擴散生成模型。該框架的核心思想是在優化過程中引入“向後反思”來改進“向前生成”。具體而言,RA-GRPO首先引入了“擴散反思”(Diffusion Reflection)機制,通過使用一個弱估計器反轉擴散過程,對中間採樣軌跡進行矯正,將潛在狀態引導至真實數據流形中概率更高的區域。這一機制能夠在採樣過程中及時修正偏離方向的軌跡,從而緩解探索不足的問題。其次,框架提出了“反事實路徑合成”(Counterfactual Path Synthesis)方法,將矯正後的軌跡隱式地蒸餾到策略中,使模型能夠內化基於搜索的探索所帶來的益處,而無需在推理時增加額外開銷。通過在T2I和T2V模型上進行的大量實驗,RA-GRPO在緩解獎勵黑客行為(reward hacking)以及提升泛化能力方面均顯著優於現有方法。值得注意的是,該方法與具體架構無關,可以無縫集成到標準擴散模型流程中,為穩定偏好對齊提供了一個極具前景的方向。該研究論文已提交至arXiv平台,論文編號為2609.04282,作者包括Junlong Wu等共10位研究者,於2026年9月3日首次提交,屬於計算機視覺與模式識別(cs.CV)領域。研究團隊在摘要中詳細闡述了現有方法在探索效率上的不足:許多策略梯度方法僅依賴生成結果與人類偏好之間的獎勵信號,卻忽略了生成過程中的中間狀態信息,導致優化路徑缺乏引導。RA-GRPO的靈感類似於“以退為進”的策略——通過暫時性的“倒退”來修正潛在表示,使最終輸出更貼合真實數據分佈。擴散反思機制的關鍵在於,它利用一個較弱的估計器計算去噪過程中的誤差,並將誤差信號用於調整採樣路徑,從而避免模型在低概率區域中盲目搜索。反事實路徑合成則通過對比實際軌跡與矯正軌跡的差異,構建出虛擬的最優路徑,使策略在訓練階段就能學習到接近最優的探索行為。實驗部分,研究團隊在多個T2I和T2V基準上驗證了方法的有效性,結果顯示RA-GRPO在圖像質量和語義一致性指標上均有提升,同時降低了獎勵黑客的發生頻率,即模型不再通過鑽取獎勵函數的漏洞來獲取高分。該方法有望為擴散模型的對齊訓練提供更穩定且可靠的解決方案。

展開要點與分析

文章情報

工程師進階

要點

  • RA-GRPO 在擴散生成模型的強化學習對齊中引入“反思”機制,彌補現有策略梯度方法探索效率低、易陷入局部最優的問題。
  • Diffusion Reflection 通過反轉擴散過程修正中間採樣軌跡,將隱狀態引導至真實數據分佈的高概率區域。
  • Counterfactual Path Synthesis 將修正後的軌跡蒸餾到策略中,使模型無需推理期額外搜索即可受益。
  • 在文生圖和文生視頻任務上超過現有方法,有效抑制獎勵黑客並改善泛化,且架構無關、便於集成。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。