本論文は、Shunpeng Chen氏を含む9名の著者によって執筆され、2026年9月3日にarXiv:2609.04369v1としてコンピュータビジョンとパターン認識(cs.CV)分野へ投稿されました。論文は18ページ・9図・9表で構成され、PDF版に加えて実験的なHTML版やTeXソースも公開されています。
Visual Place Recognition(VPR)は、クエリ画像と同じ場所またはその近傍を撮影したデータベース画像を検索することで位置を特定する技術であり、自動運転やロボット、拡張現実などで幅広く利用されています。しかし実際の環境では、照明、天候、季節の変化、歩行者や車両などの動的遮蔽物によってドメインシフトが発生し、同じ場所でも画像の見た目が大きく変わります。著者らは、既存の訓練データには同一場所の外観多様性が十分に含まれておらず、これがVPRのロバスト性を制約する要因の一つであると指摘しています。
AdaptVPRは、この問題を解決するために提案された経路認識型の生成拡張フレームワークです。まず視覚言語モデルがシーンの属性を解析し、画像の編集可能性を推定します。続いてルールベースのスケジューラが、編集可能性スコアとリスク制約に基づいて生成経路を選択します。生成処理は3つの相補的な経路に分解されます。グローバル外観経路は天候、照明、時間帯などのシーン全体の変化を導入し、ローカル遮蔽経路は文脈に合った動的遮蔽物を挿入します。そしてデュアル経路は、これら両方の摂動を組み合わせて、より困難な外観シフトを生成します。
各生成候補は、VPR向けに設計された検証スキームで評価されます。この検証は幾何的一貫性を確認して構造的ドリフトを防ぎつつ、外観多様性を確認して十分な学習信号が得られることを保証します。グローバル外観の候補は一度だけ生成され、検証に失敗すると破棄されます。一方、ローカル遮蔽とデュアル経路の候補は、検証結果に基づいて限定的なプロンプト修正と再生成を行えます。この手法により構築されたAdaptCitiesデータセットには、16万件の検証済み合成同所ハードポジティブが含まれています。
実験では、複数のVPRベースラインモデルと視覚基盤モデルのバックボーンを用いて評価が行われました。結果は標準ベンチマークでの一貫した改善を示し、ドメインシフトが厳しいタスクではRecall@1を最大9.2%向上させました。ソースコードとデータはhttps://github.com/chenshunpeng/AdaptVPRで公開されており、再現研究や応用に利用できます。