阿里巴巴Qwen-Image-2.0:压缩率翻倍,生成步骤从40步降至4步
阿里巴巴技术报告详解Qwen-Image-2.0图像模型:采用16倍空间下采样、去掉鉴别器、改进Transformer架构、集成提示扩展模块,并通过蒸馏将推理步骤从40步降至4步。模型在LMArena排名第九。
阿里巴巴近日发布技术报告,详细介绍了其最新图像生成模型Qwen-Image-2.0。该模型在训练和推理效率上实现了显著提升,核心改进包括更激进的压缩变分自编码器(VAE)、重新设计的图像Transformer,以及一个专门用于扩展用户简短提示的模块。
图像模型通常不直接处理原始像素,而是通过VAE将图像压缩为更小的潜在表示,再从中重建完整图像。压缩率越高,图像模型本身的训练就越快、成本越低。目前大多数开源模型采用8倍空间下采样,例如FLUX.1-dev和HunyuanVideo。而Qwen-Image-2.0则实现了16倍下采样,将压缩率翻倍。
高压缩率通常会导致细节丢失,但Qwen团队通过两种方式应对:一是在压缩器中加入跳跃连接,将细粒度图像信息绕过瓶颈层传递;二是在训练过程中塑造潜在空间,使其捕捉有语义意义的结构,为图像模型提供更干净的“工作空间”。值得注意的是,这种对齐压力仅在训练早期较强,后期会逐渐减弱。
此外,Qwen团队完全去除了大多数VAE中使用的鉴别器(discriminator),认为它在大规模训练中“基本冗余”且会导致训练不稳定。即使采用更激进的压缩,该VAE在标准ImageNet数据集上的重建分数仍高于使用较低压缩率的竞争对手。
Qwen-Image-2.0的核心是一个多模态扩散Transformer,它在一个流中同时处理文本和图像令牌。文本条件来自Qwen3-VL视觉语言模型(权重冻结)。团队对Transformer本身做了两处架构调整:一是简化了内部缩放机制,仅保留乘法部分;二是用SwiGLU替换了注意力层之间的前馈块。
SwiGLU的引入源于一个特定的训练问题:当模型联合学习文本和图像时,某些内部值会飙升到极端幅度,导致神经元在训练早期永久饱和。大型语言模型研究者称这种现象为“大规模激活”。SwiGLU能将值维持在有效范围内。
复杂输出(如信息图或海报)需要详细的提示,但用户通常只输入简短模糊的请求。Qwen-Image-2.0通过一个基于Qwen3.5-9B的上游模块解决这一差距,该模块将简短输入转化为丰富的描述。
该模块的训练方法不同寻常:团队从现有的丰富图像描述出发,系统性地移除其中的细节(如光照、纹理、布局),直至每条描述读起来像普通用户的输入。每次删除步骤都自动产生训练信号——即如何添加回缺失细节的“配方”。
模块分两阶段训练:首先从这些合成对中学习;然后生成候选提示,由冻结的图像生成器渲染结果,并优化模块以使结果看起来良好且符合意图。
在对齐人类偏好的最后阶段,团队使用了五个独立的奖励模型:三个用于评估新生成图像的美学、提示保真度和肖像质量;另外两个用于评估编辑图像对指令的遵循程度以及与原图的偏离程度。
一个实用的捷径是:分类器无关引导(CFG)仅在生成训练样本时运行,优化循环中不运行,从而在不影响质量的前提下降低计算成本。
团队还构建了一个自优化的训练数据管理管道。当评估或用户反馈显示糟糕输出时,系统会自动将每个失败归入三类根本原因之一:若强化学习有问题,则调整奖励信号;若模型缺少知识,则自动搜索训练数据中的缺口并添加针对性新样本;若提示模块是弱点,则重新训练。报告称人类仅在最终审查和过滤时介入。
训练数据随着图像分辨率从256像素逐步提升到2048像素,共经历六个阶段。生成数据与编辑数据的比例也从早期9:1逐渐调整为后期7:3。
扩散模型通常通过多步去噪生成图像。为加速推理,团队将完整模型蒸馏为轻量版本,仅需4步而非40步。蒸馏过程不试图复现逐步骤的生成路径,而是直接匹配最终输出。据报告,视觉质量保持在相当水平。
Qwen-Image-2.0最初以邀请制API测试版在阿里云上线,并在Qwen Chat中提供演示。在阿里巴巴内部LMArena平台的盲测中,它目前排名第九,落后于OpenAI、Google、Microsoft AI、Reve和xAI等公司的专有模型。
开放源代码发布尚未确定。虽然阿里巴巴在首次发布Qwen图像模型约一个月后以Apache 2.0许可开源了第一版,但Qwen-Image-2.0的权重尚未发布。该模型也加入了中国图像模型在准确文本渲染方面的竞争浪潮,包括美团的长龙图像和智谱AI的GLM图像。