AI News HubLIVE
站內改寫3 分鐘閱讀

阿里巴巴Qwen-Image-2.0:壓縮率翻倍,生成步驟從40步降至4步

阿里巴巴技術報告詳解Qwen-Image-2.0圖像模型:採用16倍空間下采樣、去掉鑑別器、改進Transformer架構、集成提示擴展模塊,並通過蒸餾將推理步驟從40步降至4步。模型在LMArena排名第九。

來源The Decoder作者: Jonathan Kemper

阿里巴巴近日發佈技術報告,詳細介紹了其最新圖像生成模型Qwen-Image-2.0。該模型在訓練和推理效率上實現了顯著提升,核心改進包括更激進的壓縮變分自編碼器(VAE)、重新設計的圖像Transformer,以及一個專門用於擴展用户簡短提示的模塊。

圖像模型通常不直接處理原始像素,而是通過VAE將圖像壓縮為更小的潛在表示,再從中重建完整圖像。壓縮率越高,圖像模型本身的訓練就越快、成本越低。目前大多數開源模型採用8倍空間下采樣,例如FLUX.1-dev和HunyuanVideo。而Qwen-Image-2.0則實現了16倍下采樣,將壓縮率翻倍。

高壓縮率通常會導致細節丟失,但Qwen團隊通過兩種方式應對:一是在壓縮器中加入跳躍連接,將細粒度圖像信息繞過瓶頸層傳遞;二是在訓練過程中塑造潛在空間,使其捕捉有語義意義的結構,為圖像模型提供更乾淨的“工作空間”。值得注意的是,這種對齊壓力僅在訓練早期較強,後期會逐漸減弱。

此外,Qwen團隊完全去除了大多數VAE中使用的鑑別器(discriminator),認為它在大規模訓練中“基本冗餘”且會導致訓練不穩定。即使採用更激進的壓縮,該VAE在標準ImageNet數據集上的重建分數仍高於使用較低壓縮率的競爭對手。

Qwen-Image-2.0的核心是一個多模態擴散Transformer,它在一個流中同時處理文本和圖像令牌。文本條件來自Qwen3-VL視覺語言模型(權重凍結)。團隊對Transformer本身做了兩處架構調整:一是簡化了內部縮放機制,僅保留乘法部分;二是用SwiGLU替換了注意力層之間的前饋塊。

SwiGLU的引入源於一個特定的訓練問題:當模型聯合學習文本和圖像時,某些內部值會飆升到極端幅度,導致神經元在訓練早期永久飽和。大型語言模型研究者稱這種現象為“大規模激活”。SwiGLU能將值維持在有效範圍內。

複雜輸出(如信息圖或海報)需要詳細的提示,但用户通常只輸入簡短模糊的請求。Qwen-Image-2.0通過一個基於Qwen3.5-9B的上游模塊解決這一差距,該模塊將簡短輸入轉化為豐富的描述。

該模塊的訓練方法不同尋常:團隊從現有的豐富圖像描述出發,系統性地移除其中的細節(如光照、紋理、佈局),直至每條描述讀起來像普通用户的輸入。每次刪除步驟都自動產生訓練信號——即如何添加回缺失細節的“配方”。

模塊分兩階段訓練:首先從這些合成對中學習;然後生成候選提示,由凍結的圖像生成器渲染結果,並優化模塊以使結果看起來良好且符合意圖。

在對齊人類偏好的最後階段,團隊使用了五個獨立的獎勵模型:三個用於評估新生成圖像的美學、提示保真度和肖像質量;另外兩個用於評估編輯圖像對指令的遵循程度以及與原圖的偏離程度。

一個實用的捷徑是:分類器無關引導(CFG)僅在生成訓練樣本時運行,優化循環中不運行,從而在不影響質量的前提下降低計算成本。

團隊還構建了一個自優化的訓練數據管理管道。當評估或用户反饋顯示糟糕輸出時,系統會自動將每個失敗歸入三類根本原因之一:若強化學習有問題,則調整獎勵信號;若模型缺少知識,則自動搜索訓練數據中的缺口並添加針對性新樣本;若提示模塊是弱點,則重新訓練。報告稱人類僅在最終審查和過濾時介入。

訓練數據隨着圖像分辨率從256像素逐步提升到2048像素,共經歷六個階段。生成數據與編輯數據的比例也從早期9:1逐漸調整為後期7:3。

擴散模型通常通過多步去噪生成圖像。為加速推理,團隊將完整模型蒸餾為輕量版本,僅需4步而非40步。蒸餾過程不試圖復現逐步驟的生成路徑,而是直接匹配最終輸出。據報告,視覺質量保持在相當水平。

Qwen-Image-2.0最初以邀請制API測試版在阿里雲上線,並在Qwen Chat中提供演示。在阿里巴巴內部LMArena平台的盲測中,它目前排名第九,落後於OpenAI、Google、Microsoft AI、Reve和xAI等公司的專有模型。

開放源代碼發佈尚未確定。雖然阿里巴巴在首次發佈Qwen圖像模型約一個月後以Apache 2.0許可開源了第一版,但Qwen-Image-2.0的權重尚未發佈。該模型也加入了中國圖像模型在準確文本渲染方面的競爭浪潮,包括美團的長龍圖像和智譜AI的GLM圖像。