本文にスキップ
AI News HubLIVE
サイト内リライト1 分で読了

一歩下がって前進する:視覚生成のためのリフレクションを考慮した選好最適化

記事の要約

拡散モデルを人間の好みに合わせる強化学習手法に「後ろ向きの振り返り」を組み込んだRA-GRPOを提案。Diffusion Reflectionによる中間軌道の修正とCounterfactual Path Synthesisによるポリシーへの蒸留により、報酬ハッキングを抑えながら汎化性能を向上させ、文生図・文生動画の両タスクで既存手法を上回る。

ソースarXiv Computer Vision著者: Junlong Wu, Jiuzhou Lin, Jia Sun, Boheng Zhang, Huaiqing Wang, Dewen Fan, Houde Liu, Qianqian Gan, Fan Yang, Tingting Gao
一歩下がって前進する:視覚生成のためのリフレクションを考慮した選好最適化
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

近年、拡散モデルは画像・動画生成の標準的な枠組みとなり、text-to-imageやtext-to-videoなど多様なマルチメディア生成に貢献してきた。こうしたモデルを人間の選好に合わせるため、強化学習(RL)を後段トレーニングとして用いる手法が注目されている。しかし既存のポリシー勾配法は探索が非効率で、局所最適に陥りやすく、結果として意味的な忠実さや視覚的リアリズムが損なわれることがある。Junlong Wu氏ら10名の研究チームが提案するRA-GRPOは、そうした課題に対し、生成の「前向き」なプロセスに「後ろ向き」のリフレクションを導入する手法である。

提案手法の中心となるのは、Diffusion ReflectionとCounterfactual Path Synthesisの2つの仕組みだ。Diffusion Reflectionは、弱い推定器を用いて拡散過程を反転させることにより、中間サンプリング経路を修正し、潜在状態を真のデータ多様体の高確率領域へ誘導する。これは誤差が増幅される前に軌道を修正する「セルフチェック」の役割を果たす。もう一方のCounterfactual Path Synthesisは、修正された軌道を暗黙的にポリシーへ蒸留する。これによってモデルは、推論時に追加コストをかけることなく、探索に基づく改善の恩恵を内部化できる。

研究チームは、text-to-imageとtext-to-videoの両モデルに対して大規模な実験を実施。RA-GRPOは既存手法を大きく上回り、特に報酬ハッキングの抑制と一般化性能の向上で顕著な成果を示した。さらに、アーキテクチャに依存しないため、既存の標準的なトレーニングパイプラインにそのまま統合できる点も利点だ。この論文は2026年9月3日にarXiv(2609.04282)へ投稿され、Computer Vision and Pattern Recognition(cs.CV)に分類されている。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 既存のポリシー勾配法は探索が非効率で局所最適に陥りやすく、意味的忠実さや視覚的リアリズムが損なわれると指摘。
  • Diffusion Reflectionは弱い推定器で拡散過程を反転させ、中間サンプリング軌道を真のデータ多様体の高確率領域へ補正する。
  • Counterfactual Path Synthesisは補正済み軌道を暗黙的にポリシーへ蒸留し、推論時オーバーヘッドなしに探索の恩恵を内部化する。
  • アーキテクチャに依存せず標準パイプラインへ統合可能で、T2I/T2V実験では報酬ハッキングの軽減と汎化改善に顕著な効果を示した。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。