AI News HubLIVE
サイト内リライト1 分で読了

VQ-Transplant: 事前学習済みビジュアルトークナイザのための効率的なVQモジュール統合

VQ-Transplantは、新しいベクトル量子化モジュールを凍結済みの事前学習済みトークナイザにプラグアンドプレイで統合する軽量フレームワークを提案する。ImageNet-1kでわずか5エポック学習する軽量デコーダ適応戦略により量子化ミスマッチを緩和し、VARなどの産業レベルのモデルで最先端に近い再構成品質を達成しながら、トレーニングコストを95%削減する。これにより量子化研究の民主化が進み、リソース制約下でも新しいVQ技術の探索が可能になる。

ソースarXiv Computer Vision著者: Xianghong Fang, Yuan Yuan, Dehan Kong, Tim G. J. Rudner

コンピュータビジョンの分野において、ベクトル量子化(VQ)は、画像生成や認識などのタスクで使用される現代の離散ビジュアルトークナイゼーションの基盤技術です。しかし、VARのような最先端のVQベースモデルの量子化モジュールを訓練するには、数千GPU時間に相当する膨大な計算リソースが必要であり、リソースが限られた環境では新しいVQ技法の開発が事実上妨げられていました。

この問題に対処するため、北京航空航天大学とオックスフォード大学の研究チームは、VQ-Transplantというフレームワークを提案しました。その核心は「プラグアンドプレイ」方式で、事前学習済みトークナイザのエンコーダ・デコーダを凍結したまま、新しいVQモジュールを既存のものと置き換えるだけです。これにより、コストのかかるエンドツーエンドの再学習が不要になります。

置き換えによって生じるデコーダと新しい量子化空間とのミスマッチを緩和するため、軽量なデコーダ適応戦略が導入されました。この戦略は、ImageNet-1kデータセットでわずか5エポックの訓練を行うだけで、特徴の事前分布を新しい量子化空間に適合させます。実験評価では、VQ-TransplantによりVARなどの産業レベルのモデルにおいて最先端に近い再構成品質を達成し、かつ訓練コストを95%削減できることが示されました。

VQ-Transplantは、新しいVQ技術の統合をリソース効率よく実現することで、量子化研究の民主化を促進します。論文は20ページ、9図、16表からなり、2026年7月21日にarXivに提出され、著者はXianghong Fang、Yuan Yuan、Dehan Kong、Tim G.J. Rudnerです。この研究は、将来の離散ビジュアル表現手法の開発に新たな道を開くものと期待されます。