本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

AdaptVPR: ロバストなVisual Place Recognitionのための経路認識型ハードポジティブ生成

記事の要約

Visual Place Recognition(VPR)は、照明・天候・季節・動的な遮蔽などのドメインシフトにより性能が低下しやすい。その一因は、同一場所の外観多様性が訓練データに乏しいことにある。本論文のAdaptVPRは、視覚言語モデルでシーン属性と編集可能性を推定し、ルールベースのスケジューラで生成経路を決定。グローバル外観・ローカル遮蔽・デュアルの3経路で「同一場所のハードポジティブ」を生成し、幾何的一貫性と外観多様性に基づく検証を実施する。構築したAdaptCitiesは16万件の検証済み合成ハードポジティブを含み、複数のVPRベースラインでR@1を最大9.2%向上させる。

ソースarXiv Computer Vision著者: Shunpeng Chen, Jingyi Zhang, Changwei Wang, Shengpeng Xu, Yukun Song, Xingtian Pei, Jinzhou Lin, Li Guo, Shibiao Xu
AdaptVPR: ロバストなVisual Place Recognitionのための経路認識型ハードポジティブ生成
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

本論文は、Shunpeng Chen氏を含む9名の著者によって執筆され、2026年9月3日にarXiv:2609.04369v1としてコンピュータビジョンとパターン認識(cs.CV)分野へ投稿されました。論文は18ページ・9図・9表で構成され、PDF版に加えて実験的なHTML版やTeXソースも公開されています。

Visual Place Recognition(VPR)は、クエリ画像と同じ場所またはその近傍を撮影したデータベース画像を検索することで位置を特定する技術であり、自動運転やロボット、拡張現実などで幅広く利用されています。しかし実際の環境では、照明、天候、季節の変化、歩行者や車両などの動的遮蔽物によってドメインシフトが発生し、同じ場所でも画像の見た目が大きく変わります。著者らは、既存の訓練データには同一場所の外観多様性が十分に含まれておらず、これがVPRのロバスト性を制約する要因の一つであると指摘しています。

AdaptVPRは、この問題を解決するために提案された経路認識型の生成拡張フレームワークです。まず視覚言語モデルがシーンの属性を解析し、画像の編集可能性を推定します。続いてルールベースのスケジューラが、編集可能性スコアとリスク制約に基づいて生成経路を選択します。生成処理は3つの相補的な経路に分解されます。グローバル外観経路は天候、照明、時間帯などのシーン全体の変化を導入し、ローカル遮蔽経路は文脈に合った動的遮蔽物を挿入します。そしてデュアル経路は、これら両方の摂動を組み合わせて、より困難な外観シフトを生成します。

各生成候補は、VPR向けに設計された検証スキームで評価されます。この検証は幾何的一貫性を確認して構造的ドリフトを防ぎつつ、外観多様性を確認して十分な学習信号が得られることを保証します。グローバル外観の候補は一度だけ生成され、検証に失敗すると破棄されます。一方、ローカル遮蔽とデュアル経路の候補は、検証結果に基づいて限定的なプロンプト修正と再生成を行えます。この手法により構築されたAdaptCitiesデータセットには、16万件の検証済み合成同所ハードポジティブが含まれています。

実験では、複数のVPRベースラインモデルと視覚基盤モデルのバックボーンを用いて評価が行われました。結果は標準ベンチマークでの一貫した改善を示し、ドメインシフトが厳しいタスクではRecall@1を最大9.2%向上させました。ソースコードとデータはhttps://github.com/chenshunpeng/AdaptVPRで公開されており、再現研究や応用に利用できます。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 視覚言語モデルとルールベーススケジューラにより、VPR訓練用の同所ハードポジティブを生成する。
  • グローバル外観・ローカル遮蔽・デュアルの3つの相補的経路が異なる外観シフトをカバーする。
  • 幾何的一貫性と外観多様性の検証により、構造的ドリフトを抑えつつ十分な外観変化を確保する。
  • AdaptCitiesの16万検証済みサンプルにより、困難なドメインシフト下でR@1を最大9.2%改善。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。