UniVL:用于空间接地上下文图像生成的统一视觉语言嵌入
UniVL提出一种统一视觉语言嵌入方法,通过将文本指令渲染到空间掩码上,消除对独立文本编码器的需求,实现高效、可控的图像生成。在UniVL-ImgGen基准上,FID从14降至11,PSNR从16升至20,推理TFLOPs减少52%,运行时间减少44%。
UniVL是一种新颖的统一视觉语言嵌入方法,旨在解决空间接地上下文图像生成任务。与传统的图像条件生成方法不同,传统方法需要分别使用视觉编码器和文本编码器处理参考图像和全局文本提示,而UniVL通过将文本指令直接渲染到空间掩码上,创建一个统一的视觉输入,从而消除了对单独文本编码器的需求。这一设计不仅简化了模型架构,还显著降低了推理时的计算负担。
UniVL的核心在于其编码器的设计。该编码器基于光学字符识别(OCR)预训练的骨干网络进行改进,能够光学地读取统一的条件输入,并生成一种名为fVIL的嵌入表示。这种嵌入将视觉信息、语义意图和空间位置融合在一个单一的标记序列中。为了有效利用这一嵌入,研究者提出了两阶段流水线:第一阶段将UniVL嵌入与变分自编码器(VAE)的嵌入空间对齐;第二阶段则使用UniVL嵌入直接条件化预训练的扩散骨干网络,完全取代了T5等独立文本编码器。这一流水线确保了UniVL嵌入能够无缝地融入现有的扩散模型中,无需对生成网络进行大量修改。
在性能评估方面,研究者构建了UniVL-ImgGen基准数据集,该数据集包含477K张带有空间掩码标注的图像,覆盖了多种场景和物体类别。实验结果表明,UniVL在图像质量上显著优于基于文本提示的基线方法:FID从14降至11,PSNR从16提升至20。更重要的是,由于移除了文本编码器,推理时的TFLOPs减少了高达52%,运行时间缩短了44%。这些指标的提升不仅表明UniVL在生成质量上的优势,也展示了其在计算效率上的巨大潜力。消融研究进一步验证了各个组件的贡献,包括OCR预训练、两阶段对齐以及嵌入融合策略等。
UniVL的提出为可控图像生成开辟了新方向,特别是在需要精确控制物体位置和语义的场景中,如增强现实、游戏开发和交互式设计等。通过将语言指令直接嵌入空间位置,UniVL实现了更直观、高效的交互方式,同时保持了高质量的生成效果。此外,统一视觉输入的设计也使得模型更容易适应新的任务和数据集,具有很好的泛化能力。未来,研究者计划将UniVL扩展到视频生成和3D场景生成等更复杂的领域,进一步验证其统一条件范式的有效性。