AI News HubLIVE
站内改写1 分钟阅读

VQ-Transplant: 针对预训练视觉分词器的高效VQ模块集成方法

VQ-Transplant提出了一种轻量级框架,能够将新的向量量化模块无缝集成到冻结的预训练分词器中,无需昂贵的端到端重训练。通过在ImageNet-1k上仅训练5个epoch的轻量级解码器适配策略,该方法解决了量化不匹配问题,在VAR等工业级模型上实现了接近最先进的重建保真度,同时训练成本降低95%。这降低了量化研究门槛,使资源受限环境中的研究者也能探索前沿技术。

来源arXiv Computer Vision作者: Xianghong Fang, Yuan Yuan, Dehan Kong, Tim G. J. Rudner

在计算机视觉领域,向量量化(VQ)是现代离散视觉分词技术的核心,广泛应用于图像生成、理解等任务。然而,基于VQ的先进模型(如VAR)需要训练专用的量化模块,这一过程通常需要大量的计算资源,例如数千GPU小时。这严重阻碍了在资源受限条件下开发新型VQ技术,使得许多研究者无法参与到前沿探索中。

为了解决这一瓶颈,来自北京航空航天大学和牛津大学的研究团队联合提出了VQ-Transplant框架。该框架的核心思路是“即插即用”:将新的VQ模块直接替换预训练分词器中原有的量化模块,而无需重新训练整个编码器-解码器结构。具体来说,VQ-Transplant通过冻结预训练视觉分词器的所有编码器和解码器参数,仅对新的量化模块进行训练,从而避免了昂贵的端到端重训练。

然而,直接替换量化模块会导致解码器与新的量化空间之间存在不匹配问题。为此,研究团队设计了一种轻量级的解码器适配策略。该策略在ImageNet-1k数据集上仅训练5个epoch,通过一个简单的解码器适配层来对齐特征先验与新的量化空间。实验结果表明,这种方法能有效缓解量化不匹配,使得VQ-Transplant在VAR等工业级模型上获得接近最先进水平的重建保真度,同时将训练成本降低95%。

VQ-Transplant的提出具有重要价值。它不仅使研究者能够以极低的成本尝试各种新型VQ技术,还推动了量化研究的民主化。论文共20页,包含9张图和16张表,于2026年7月21日提交至arXiv,作者包括Xianghong Fang、Yuan Yuan、Dehan Kong和Tim G. J. Rudner。该工作为视觉分词领域的发展开辟了新路径,有望加速下一代离散视觉表示方法的研发。