单一模型,三种模态:字节跳动发布Lance,实现图像与视频的理解、生成和编辑
字节跳动智能创作实验室发布了Lance,一个开源的、原生的统一多模态模型,能够在单一框架内处理图像和视频的理解、生成和编辑,仅使用30亿激活参数。Lance采用双流混合专家架构和模态感知旋转位置编码(MaPE),通过四个阶段的训练实现了在多项基准测试中的领先性能,包括图像生成、视频生成、图像编辑和视频理解,且开源发布。
构建一个既能理解又能生成图像和视频的单一模型,难度远超想象。这两类任务要求截然相反:理解受益于与语言紧密对齐的高层语义特征,而生成则需要保留纹理、几何和时间动态的低层连续表示。大多数系统通过将两者分离到不同架构,再进行后期桥接来处理这一矛盾。
字节跳动研究团队采用了不同的方法。他们设计的Lance模型原生集成了图像和视频模态的理解、生成和编辑能力,从训练之初就进行联合训练。
Lance将其能力组织为三个输出族:文本(X2T)、图像(X2I)和视频(X2V)。理解方面涵盖图像和视频描述、视觉问答、OCR、视觉定位和推理。生成方面涵盖文本到图像、文本到视频、图像到视频、主体驱动生成、图像编辑和视频编辑,包括跨模态的多轮一致性编辑。
这一全能型能力是一个重要里程碑。虽然标准的统一架构通常只停留在基本图像理解和文本到图像生成,但Lance是少数能够原生桥接整个图像-视频生态系统(包括理解和生成任务)的模型之一。
架构基于两个原则:统一上下文建模和解耦能力通路。对于统一上下文,Lance将所有输入(文本、图像和视频)转换为单一的共享交错多模态序列。文本token来自Qwen2.5-VL嵌入层。面向理解的视觉输入由Qwen2.5-VL ViT编码器产生紧凑的语义视觉token。面向生成的视觉输入由Wan2.2 3D因果VAE编码器将图像和视频编码为连续潜在表示,进行16倍空间下采样和4倍时间下采样。所有这些异构token类型(文本、语义视觉和潜在视觉)都位于同一序列中。模型随后对整个上下文运行广义3D因果注意力,文本token使用因果注意力,视觉token使用双向注意力。
对于解耦通路,Lance使用从Qwen2.5-VL 3B初始化的双流混合专家架构。理解专家(LLM_UND)处理文本和语义视觉token,产生多模态推理和文本生成的输出。生成专家(LLM_GEN)处理VAE潜在token以进行视觉合成和编辑。关键的是,两个专家操作于相同的共享交错序列上——它们共享上下文但不竞争同一参数。理解专家使用下一个token预测损失训练;生成专家使用连续潜在空间中的流匹配目标训练。两个损失在训练过程中以可配置的权重组合。
为了解决标准3D-RoPE无法区分不同视觉token组的问题,Lance引入了模态感知旋转位置编码(MaPE)。MaPE根据每个模态组在序列中的索引应用固定的时间偏移。空间坐标保持不变,因此图像和视频中的内在布局得以保留。时间偏移足以在全局位置空间中分离token组,而不破坏任何单个视频内的时间顺序。移除MaPE会导致GenEval从80.94降至80.56,GEdit-Bench从6.86降至6.30,VBench从81.81降至80.95——在生成、编辑和理解任务上均出现一致退化。
Lance通过四个连续阶段训练:预训练(约1B图像-文本对和140M视频-文本对,1.5T训练token)、持续训练(约300B token,引入交错多任务数据)、监督微调(72B token,优化指令遵循和编辑精度)和强化学习(使用GRPO和PaddleOCR奖励模型)。整个训练在最多128个GPU的预算内完成。
在基准测试中,Lance展现出强劲性能:图像生成GenEval总体得分0.90,与TUNA并列统一模型第一;视频生成VBench总分85.11,是统一模型中最高的,甚至超过专用生成模型HunyuanVideo和Wan2.1-T2V;图像编辑GEdit-Bench得分7.30 Avg/G_O,也是统一模型最高;视频理解MVBench得分62.0,同样领先于其他统一模型。
Lance已经在Apache 2.0许可下开源,模型权重可在Hugging Face获取。