跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

基於樣本引導分佈匹配的視頻生成聯合對齊與蒸餾

文章摘要

該論文提出一種面向視頻生成模型的單階段聯合優化框架DM-Align,將人類偏好對齊與蒸餾統一到分佈匹配中,通過互補的偏好引導梯度避免傳統強化學習的高計算開銷,實驗表明其能同時提升蒸餾質量與偏好對齊效果。

來源arXiv Computer Vision作者: Jiuzhou Lin, Junlong Wu, Fei Zuo, Huan Ouyang, Dewen Fan, Boheng Zhang, Huaiqing Wang, Jia Sun, Fan Yang, Houde Liu, Kehai Chen, Min Zhang, Tingting Gao, Han Li
基於樣本引導分佈匹配的視頻生成聯合對齊與蒸餾
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在視頻生成模型與人類偏好對齊的研究中,強化學習(RL)雖被廣泛應用,但計算開銷極為龐大。當前工作通常將RL與蒸餾視為隔離階段:在蒸餾之前實施RL,運算成本難以承受;在蒸餾之後實施RL,則經常導致模型崩塌。為了解決上述侷限,來自研究者團隊提出了一套立足於分佈匹配(Distribution Matching, DM)的統一單階段優化框架。該論文已於2026年9月3日提交到arXiv,論文編號為2609.04283。\n\n在標準DM框架裏,蒸餾環節通過使真實模型與近似模型之間的差距最小化的梯度方向來更新網絡,引導生成結果朝向清晰度與高保真度。在此基礎上,該論文所提出的DM-Align方法推導出一個互補的梯度方向,以引導模型靠近符合人類偏好的樣本。結合DPO(直接偏好優化)與GRPO(組相對策略優化)的啓發,本方法藉助由偏好對或組內探索得到的分佈性差距,直接構建這種由偏好牽引導梯度。該梯度方向與蒸餾梯度的協同應用,消除了常規RL中多步獎勵評估以及繁複的ODE-SDE轉換需求。實驗覆蓋多類基礎視頻模型,證明該由樣本引導的訓練框架能穩健地同時改善蒸餾質量和偏好對齊效果,且在所有情況下均優於獨立變體以及順序式兩階段流程。\n\n此篇題目為 Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching 的論文由Jiuzhou Lin和另外13位共同作者完成,分頁PDF大小為14,424KB。提交人是Junlong Wu,郵件發送時間為2026年9月3日。論文的引用信息為 arXiv:2609.04283 [cs.CV],版本v1,對應DOI https://doi.org/10.48550/arXiv.2609.04283,目前待DataCite註冊。瀏覽上下文屬於cs.CV,類型為“new”和“recent”;當前日期位於2026年9月。該論文附帶PDF、實驗性HTML、TeX源文件、查看許可等全文鏈接,並提供NASA ADS、Google Scholar、Semantic Scholar等參考資料。相關的工具和推薦系統包括Bibliographic Explorer、Connected Papers、Litmaps、scite.ai、alphaXiv、CatalyzeX Code Finder、DagsHub、Gotit.pub、Hugging Face、ScienceCast、Replicate、TXYZ.AI,以及Influence Flower和CORE Recommender。此外,arXivLabs作為一個實驗性合作平台,同時也被描述於該頁面中。本文就是基於這個arXiv摘要頁面寫成的。

展開要點與分析

文章情報

工程師進階

要點

  • 現有流程將RL對齊和蒸餾分離,先RL再蒸餾計算昂貴,先蒸餾再RL易導致模型崩潰。
  • DM-Align在標準分佈匹配蒸餾梯度的基礎上,推導出朝向人類偏好樣本的互補梯度方向。
  • 該方向受DPO和GRPO啓發,可利用偏好對或組內探索形成的分佈差異直接構造,無需多步獎勵評估與ODE-SDE轉換。
  • 在多個基礎視頻模型上的實驗顯示,該框架優於獨立變體及順序兩階段流程。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。