跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

基于样本引导分布匹配的视频生成联合对齐与蒸馏

文章摘要

该论文提出一种面向视频生成模型的单阶段联合优化框架DM-Align,将人类偏好对齐与蒸馏统一到分布匹配中,通过互补的偏好引导梯度避免传统强化学习的高计算开销,实验表明其能同时提升蒸馏质量与偏好对齐效果。

来源arXiv Computer Vision作者: Jiuzhou Lin, Junlong Wu, Fei Zuo, Huan Ouyang, Dewen Fan, Boheng Zhang, Huaiqing Wang, Jia Sun, Fan Yang, Houde Liu, Kehai Chen, Min Zhang, Tingting Gao, Han Li
基于样本引导分布匹配的视频生成联合对齐与蒸馏
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

在视频生成模型与人类偏好对齐的研究中,强化学习(RL)虽被广泛应用,但计算开销极为庞大。当前工作通常将RL与蒸馏视为隔离阶段:在蒸馏之前实施RL,运算成本难以承受;在蒸馏之后实施RL,则经常导致模型崩塌。为了解决上述局限,来自研究者团队提出了一套立足于分布匹配(Distribution Matching, DM)的统一单阶段优化框架。该论文已于2026年9月3日提交到arXiv,论文编号为2609.04283。\n\n在标准DM框架里,蒸馏环节通过使真实模型与近似模型之间的差距最小化的梯度方向来更新网络,引导生成结果朝向清晰度与高保真度。在此基础上,该论文所提出的DM-Align方法推导出一个互补的梯度方向,以引导模型靠近符合人类偏好的样本。结合DPO(直接偏好优化)与GRPO(组相对策略优化)的启发,本方法借助由偏好对或组内探索得到的分布性差距,直接构建这种由偏好牵引导梯度。该梯度方向与蒸馏梯度的协同应用,消除了常规RL中多步奖励评估以及繁复的ODE-SDE转换需求。实验覆盖多类基础视频模型,证明该由样本引导的训练框架能稳健地同时改善蒸馏质量和偏好对齐效果,且在所有情况下均优于独立变体以及顺序式两阶段流程。\n\n此篇题目为 Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching 的论文由Jiuzhou Lin和另外13位共同作者完成,分页PDF大小为14,424KB。提交人是Junlong Wu,邮件发送时间为2026年9月3日。论文的引用信息为 arXiv:2609.04283 [cs.CV],版本v1,对应DOI https://doi.org/10.48550/arXiv.2609.04283,目前待DataCite注册。浏览上下文属于cs.CV,类型为“new”和“recent”;当前日期位于2026年9月。该论文附带PDF、实验性HTML、TeX源文件、查看许可等全文链接,并提供NASA ADS、Google Scholar、Semantic Scholar等参考资料。相关的工具和推荐系统包括Bibliographic Explorer、Connected Papers、Litmaps、scite.ai、alphaXiv、CatalyzeX Code Finder、DagsHub、Gotit.pub、Hugging Face、ScienceCast、Replicate、TXYZ.AI,以及Influence Flower和CORE Recommender。此外,arXivLabs作为一个实验性合作平台,同时也被描述于该页面中。本文就是基于这个arXiv摘要页面写成的。

展开要点与分析

文章情报

工程师进阶

要点

  • 现有流程将RL对齐和蒸馏分离,先RL再蒸馏计算昂贵,先蒸馏再RL易导致模型崩溃。
  • DM-Align在标准分布匹配蒸馏梯度的基础上,推导出朝向人类偏好样本的互补梯度方向。
  • 该方向受DPO和GRPO启发,可利用偏好对或组内探索形成的分布差异直接构造,无需多步奖励评估与ODE-SDE转换。
  • 在多个基础视频模型上的实验显示,该框架优于独立变体及顺序两阶段流程。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。