軌跡感知的跨視角地理定位:基於序列觀測的方法
跨視角地理定位將地面觀測與衞星圖像匹配。最新方法利用視頻片段等序列查詢獲得更豐富的時空線索,但忽略了路線描述這一互補模態。本文提出SeqGeo-VL數據集(約3.9萬視頻-文本-衞星三元組)和TrajLoc統一框架,同時處理視頻和路線描述,通過密集視覺與抽象語言語義相互增強。還提出TrajMod輕量模塊,根據軌跡幾何條件化查詢嵌入,實現空間感知表示。實驗表明TrajLoc在視頻和文本地理定位上顯著超越現有方法。
跨視角地理定位(Cross-view Geo-localization)是一項將地面拍攝的圖像或視頻與衞星圖像進行匹配的技術,在無人駕駛、機器人導航和增強現實等領域具有廣泛應用。傳統方法通常依賴單張地面圖像,但序列數據如視頻片段能夠提供更豐富的時空線索,從而提升匹配精度。然而,現有基於序列的方法大多隻考慮視覺信息,而忽略了另一種重要的序列模態——路線描述。路線描述是用自然語言描述的行進路徑,它能夠以更高的抽象層次捕捉軌跡信息,並且在實際場景中常常是唯一的輸入來源(例如用户口頭告知自動駕駛車輛接載地點)。
為了填補這一空白,由Tianyi Gao等人組成的研究團隊在ECCV 2026上發表了題為《Trajectory-aware Cross-view Geo-localization with Sequential Observations》的論文。他們提出了SeqGeo-VL數據集,該數據集包含約3.9萬個視頻-文本-衞星三元組,覆蓋了多樣化的地理場景和天氣條件。在此基礎上,團隊構建了TrajLoc統一框架,該框架能夠同時處理視頻片段和路線描述兩種模態的查詢。通過利用密集視覺特徵與抽象語言語義的相互增強,TrajLoc顯著提升了跨視角匹配的準確性和魯棒性。
TrajLoc的核心創新之一是TrajMod輕量模塊。該模塊利用軌跡幾何信息(如路徑形狀和方向變化)對查詢嵌入進行條件化,從而生成空間感知的表示。這種表示能夠更好地對齊地面軌跡與衞星圖像中的對應區域。實驗在多個數據集上驗證了TrajLoc的有效性:在視頻地理定位任務中,它比現有最優方法提升了超過10%的召回率;在文本地理定位任務中,也取得了顯著的性能提升。項目主頁和代碼已公開,為後續研究提供了堅實的基礎。