ビデオ生成モデルを人間の好みに合わせる作業は、これまで強化学習(RL)に大きく依存してきましたが、多くの計算コストがかかります。既存のパイプラインではRLと蒸留を別々の段階として扱い、RLを蒸留前に適用すると計算負荷が法外になり、蒸留後に適用するとモデルの崩壊を引き起こすことがよくあります。この問題に対処するため、研究グループは分布マッチング(DM)に基づく統合的な単段階最適化フレームワークを提案しました。本稿では、この論文をarXivの情報をもとに紹介します。\n\n標準的なDMフレームワークでは、蒸留によってリアルモデルとフェイクモデルの間のギャップを最小化する勾配方向でモデルを更新し、生成結果を高精細かつ高忠実度に導きます。提案手法DM-Alignは、この上に補完的な勾配方向を導出し、人間が好む標本へモデルを誘導します。DPOやGRPOに着想を得て、選好ペアまたはグループ内探索から構築した分布ギャップを直接用いて、この選好誘導勾配を作り出します。これら二つの勾配方向を相乗させることで、従来のRLに内在する多段階の報酬評価や複雑なODE-SDE変換を不要とします。\n\n複数の基盤ビデオモデルを使った総合的な実験により、この標本誘導フレームワークが蒸留品質と選好整合をロバストに向上させ、単独の変種や順次二段階パイプラインを一貫して上回ることが示されました。この研究は、強化学習と蒸留を分離する従来の方式が抱える計算コストとモデル崩壊のジレンマを解決する可能性を持ちます。\n\n論文のタイトルは "Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching"、著者はJiuzhou Lin氏を含む14名です。2026年9月3日にarXivに提出され、IDは2609.04283。分類はcs.CVです。提出者はJunlong Wu氏。v1のPDFサイズは14,424KB。DOIは https://doi.org/10.48550/arXiv.2609.04283 で、DataCiteによる登録が予定されています。現在の参照コンテキストはcs.CVの 'new' および 'recent' です。フルテキストへのリンクとしてPDF、実験的HTML、TeXソース、ライセンス表示などが提供されています。参考文献としてNASA ADS、Google Scholar、Semantic Scholarが見られます。関連ツールとしてBibliographic Explorer、Connected Papers、Litmaps、scite.ai、alphaXiv、CatalyzeX Code Finder、DagsHub、Gotit.pub、Hugging Face、ScienceCast、Replicate、TXYZ.AI、Influence Flower、CORE Recommenderが挙げられています。また、arXivLabsの説明やMathJax無効化のオプションもページに含まれています。本記事はarXivの公開情報に基づいて構成されました。
サンプル誘導型分布マッチングによるビデオ生成の統合的アライメントと蒸留
記事の要約
Jiuzhou Lin氏ら14名の著者による論文(arXiv:2609.04283v1)は、ビデオ生成モデルにおいて人間の好みへのアライメントと蒸留を単一の分布マッチング枠組みで実現するDM-Alignを提案する。強化学習に伴う高コストやモデル崩壊を回避し、複数の基盤ビデオモデルで蒸留品質と嗜好整合性を向上できることを示した。
ソースarXiv Computer Vision著者: Jiuzhou Lin, Junlong Wu, Fei Zuo, Huan Ouyang, Dewen Fan, Boheng Zhang, Huaiqing Wang, Jia Sun, Fan Yang, Houde Liu, Kehai Chen, Min Zhang, Tingting Gao, Han Li
サンプル誘導型分布マッチングによるビデオ生成の統合的アライメントと蒸留