跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

退一步,进两步:面向视觉生成的反思感知偏好优化

文章摘要

这项工作提出反思感知 GRPO(RA-GRPO),一种将“反向反思”引入前向生成的强化学习偏好对齐框架,用于扩散图像和视频生成。它通过扩散反转修正中间采样轨迹,并借助反事实路径合成将这些修正隐式蒸馏进策略,从而缓解奖励黑客、提升泛化能力,且不需要改变模型架构或带来推理开销。

来源arXiv Computer Vision作者: Junlong Wu, Jiuzhou Lin, Jia Sun, Boheng Zhang, Huaiqing Wang, Dewen Fan, Houde Liu, Qianqian Gan, Fan Yang, Tingting Gao
退一步,进两步:面向视觉生成的反思感知偏好优化
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

扩散模型已成为现代视觉生成的主流范式,显著推动了文本到图像(T2I)与文本到视频(T2V)等多媒体内容合成任务的发展。为了进一步使生成模型与人类偏好对齐,强化学习(RL)作为一种后训练策略展现出强大潜力。然而,现有的基于策略梯度的方法往往探索效率低下,容易陷入局部最优,进而可能导致语义保真度和视觉真实感的下降。针对这些问题,研究者提出了一种名为“反思感知的GRPO”(Reflection-Aware GRPO,简称RA-GRPO)的新型强化学习偏好对齐框架,专门用于扩散生成模型。该框架的核心思想是在优化过程中引入“向后反思”来改进“向前生成”。具体而言,RA-GRPO首先引入了“扩散反思”(Diffusion Reflection)机制,通过使用一个弱估计器反转扩散过程,对中间采样轨迹进行矫正,将潜在状态引导至真实数据流形中概率更高的区域。这一机制能够在采样过程中及时修正偏离方向的轨迹,从而缓解探索不足的问题。其次,框架提出了“反事实路径合成”(Counterfactual Path Synthesis)方法,将矫正后的轨迹隐式地蒸馏到策略中,使模型能够内化基于搜索的探索所带来的益处,而无需在推理时增加额外开销。通过在T2I和T2V模型上进行的大量实验,RA-GRPO在缓解奖励黑客行为(reward hacking)以及提升泛化能力方面均显著优于现有方法。值得注意的是,该方法与具体架构无关,可以无缝集成到标准扩散模型流程中,为稳定偏好对齐提供了一个极具前景的方向。该研究论文已提交至arXiv平台,论文编号为2609.04282,作者包括Junlong Wu等共10位研究者,于2026年9月3日首次提交,属于计算机视觉与模式识别(cs.CV)领域。研究团队在摘要中详细阐述了现有方法在探索效率上的不足:许多策略梯度方法仅依赖生成结果与人类偏好之间的奖励信号,却忽略了生成过程中的中间状态信息,导致优化路径缺乏引导。RA-GRPO的灵感类似于“以退为进”的策略——通过暂时性的“倒退”来修正潜在表示,使最终输出更贴合真实数据分布。扩散反思机制的关键在于,它利用一个较弱的估计器计算去噪过程中的误差,并将误差信号用于调整采样路径,从而避免模型在低概率区域中盲目搜索。反事实路径合成则通过对比实际轨迹与矫正轨迹的差异,构建出虚拟的最优路径,使策略在训练阶段就能学习到接近最优的探索行为。实验部分,研究团队在多个T2I和T2V基准上验证了方法的有效性,结果显示RA-GRPO在图像质量和语义一致性指标上均有提升,同时降低了奖励黑客的发生频率,即模型不再通过钻取奖励函数的漏洞来获取高分。该方法有望为扩散模型的对齐训练提供更稳定且可靠的解决方案。

展开要点与分析

文章情报

工程师进阶

要点

  • RA-GRPO 在扩散生成模型的强化学习对齐中引入“反思”机制,弥补现有策略梯度方法探索效率低、易陷入局部最优的问题。
  • Diffusion Reflection 通过反转扩散过程修正中间采样轨迹,将隐状态引导至真实数据分布的高概率区域。
  • Counterfactual Path Synthesis 将修正后的轨迹蒸馏到策略中,使模型无需推理期额外搜索即可受益。
  • 在文生图和文生视频任务上超过现有方法,有效抑制奖励黑客并改善泛化,且架构无关、便于集成。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。