AI News HubLIVE
站內改寫1 分鐘閱讀

利用語義地圖實現城市尺度跨視角定位

本文提出一種基於視覺語言模型(VLM)的機器人定位方法,利用OpenStreetMap的豐富語義資訊,從全景圖中提取地標並與先驗地圖匹配,透過蒸餾輕量級匹配器提高效率,並在多種環境(包括雪夜)中驗證了泛化能力。

來源arXiv Robotics作者: Ethan Fahnestock, Erick Fuentes, Philip R Osteen, Nicholas Roy

機器人定位是自主導航的核心問題之一,尤其是在從未遍歷過的環境中。傳統方法通常依賴GPS或高精地圖,但GPS在室內或城市峽谷中不可靠,而高精地圖的構建和維護成本高昂。近年來,研究者開始探索利用開源地圖資料(如OpenStreetMap)進行定位,但這些方法往往忽略其中的豐富語義資訊,直接將全景圖與航拍圖匹配,或者僅使用少數固定類別壓縮語義。

來自麻省理工學院和加州大學伯克利分校的研究團隊提出了一種基於視覺語言模型(VLM)的新方法,旨在充分利用OpenStreetMap中的語義資訊實現城市尺度的跨視角定位。該方法首先從機器人採集的全景圖中提取語義地標,例如建築、路口、標誌性設施等,然後與OpenStreetMap中的先驗語義地圖進行關聯。然而,直接使用VLM為地圖上的所有地標提議對應關係會導致計算量隨地圖規模爆炸式增長,例如在628平方公里的區域中可能包含數千個地標。

為解決這一可擴充套件性問題,研究者提出從VLM中蒸餾出一個輕量級的匹配器。該匹配器能夠高效計算地圖中所有實體與觀測地標之間的對應關係,從而形成觀測似然函式。隨後,透過貝葉斯濾波器將連續時間的觀測結果融合,生成平滑的位姿估計序列。實驗表明,即使在單一城市的好天氣資料上訓練,該方法也能推廣到不同的位置、光照條件和惡劣天氣(如波士頓的暴風雪和夜晚)。

為促進相關研究,團隊還發布了一個包含11種環境的資料集,涵蓋了提取的語義資訊和評估軌跡,包括在雪夜和夜間收集的全景圖。程式碼和資料集均已開源。這一工作為利用現成語義地圖進行魯棒定位提供了新思路,有望降低機器人部署對昂貴地圖構建的依賴。