VQ-Transplant: 針對預訓練視覺分詞器的高效VQ模組整合方法
VQ-Transplant提出了一種輕量級框架,能夠將新的向量量化模組無縫整合到凍結的預訓練分詞器中,無需昂貴的端到端重訓練。透過在ImageNet-1k上僅訓練5個epoch的輕量級解碼器適配策略,該方法解決了量化不匹配問題,在VAR等工業級模型上實現了接近最先進的重建保真度,同時訓練成本降低95%。這降低了量化研究門檻,使資源受限環境中的研究者也能探索前沿技術。
在計算機視覺領域,向量量化(VQ)是現代離散視覺分詞技術的核心,廣泛應用於影像生成、理解等任務。然而,基於VQ的先進模型(如VAR)需要訓練專用的量化模組,這一過程通常需要大量的計算資源,例如數千GPU小時。這嚴重阻礙了在資源受限條件下開發新型VQ技術,使得許多研究者無法參與到前沿探索中。
為了解決這一瓶頸,來自北京航空航天大學和牛津大學的研究團隊聯合提出了VQ-Transplant框架。該框架的核心思路是“即插即用”:將新的VQ模組直接替換預訓練分詞器中原有的量化模組,而無需重新訓練整個編碼器-解碼器結構。具體來說,VQ-Transplant透過凍結預訓練視覺分詞器的所有編碼器和解碼器引數,僅對新的量化模組進行訓練,從而避免了昂貴的端到端重訓練。
然而,直接替換量化模組會導致解碼器與新的量化空間之間存在不匹配問題。為此,研究團隊設計了一種輕量級的解碼器適配策略。該策略在ImageNet-1k資料集上僅訓練5個epoch,透過一個簡單的解碼器適配層來對齊特徵先驗與新的量化空間。實驗結果表明,這種方法能有效緩解量化不匹配,使得VQ-Transplant在VAR等工業級模型上獲得接近最先進水平的重建保真度,同時將訓練成本降低95%。
VQ-Transplant的提出具有重要價值。它不僅使研究者能夠以極低的成本嘗試各種新型VQ技術,還推動了量化研究的民主化。論文共20頁,包含9張圖和16張表,於2026年7月21日提交至arXiv,作者包括Xianghong Fang、Yuan Yuan、Dehan Kong和Tim G. J. Rudner。該工作為視覺分詞領域的發展開闢了新路徑,有望加速下一代離散視覺表示方法的研發。