在视频生成模型与人类偏好对齐的研究中,强化学习(RL)虽被广泛应用,但计算开销极为庞大。当前工作通常将RL与蒸馏视为隔离阶段:在蒸馏之前实施RL,运算成本难以承受;在蒸馏之后实施RL,则经常导致模型崩塌。为了解决上述局限,来自研究者团队提出了一套立足于分布匹配(Distribution Matching, DM)的统一单阶段优化框架。该论文已于2026年9月3日提交到arXiv,论文编号为2609.04283。\n\n在标准DM框架里,蒸馏环节通过使真实模型与近似模型之间的差距最小化的梯度方向来更新网络,引导生成结果朝向清晰度与高保真度。在此基础上,该论文所提出的DM-Align方法推导出一个互补的梯度方向,以引导模型靠近符合人类偏好的样本。结合DPO(直接偏好优化)与GRPO(组相对策略优化)的启发,本方法借助由偏好对或组内探索得到的分布性差距,直接构建这种由偏好牵引导梯度。该梯度方向与蒸馏梯度的协同应用,消除了常规RL中多步奖励评估以及繁复的ODE-SDE转换需求。实验覆盖多类基础视频模型,证明该由样本引导的训练框架能稳健地同时改善蒸馏质量和偏好对齐效果,且在所有情况下均优于独立变体以及顺序式两阶段流程。\n\n此篇题目为 Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching 的论文由Jiuzhou Lin和另外13位共同作者完成,分页PDF大小为14,424KB。提交人是Junlong Wu,邮件发送时间为2026年9月3日。论文的引用信息为 arXiv:2609.04283 [cs.CV],版本v1,对应DOI https://doi.org/10.48550/arXiv.2609.04283,目前待DataCite注册。浏览上下文属于cs.CV,类型为“new”和“recent”;当前日期位于2026年9月。该论文附带PDF、实验性HTML、TeX源文件、查看许可等全文链接,并提供NASA ADS、Google Scholar、Semantic Scholar等参考资料。相关的工具和推荐系统包括Bibliographic Explorer、Connected Papers、Litmaps、scite.ai、alphaXiv、CatalyzeX Code Finder、DagsHub、Gotit.pub、Hugging Face、ScienceCast、Replicate、TXYZ.AI,以及Influence Flower和CORE Recommender。此外,arXivLabs作为一个实验性合作平台,同时也被描述于该页面中。本文就是基于这个arXiv摘要页面写成的。
基于样本引导分布匹配的视频生成联合对齐与蒸馏
文章摘要
该论文提出一种面向视频生成模型的单阶段联合优化框架DM-Align,将人类偏好对齐与蒸馏统一到分布匹配中,通过互补的偏好引导梯度避免传统强化学习的高计算开销,实验表明其能同时提升蒸馏质量与偏好对齐效果。
来源arXiv Computer Vision作者: Jiuzhou Lin, Junlong Wu, Fei Zuo, Huan Ouyang, Dewen Fan, Boheng Zhang, Huaiqing Wang, Jia Sun, Fan Yang, Houde Liu, Kehai Chen, Min Zhang, Tingting Gao, Han Li
基于样本引导分布匹配的视频生成联合对齐与蒸馏