HyperDCM:雙曲空間中的動態聚類記憶回放實現跨場景持續機器人導航
針對視覺導航中的災難性遺忘問題,研究者提出HyperDCM,一種結構感知的記憶機制。它利用大視覺語言模型提取場景語義三元組,通過關係圖卷積網絡編碼為場景圖嵌入,並投影到雙曲空間增強結構分離性。動態聚類和結構敏感更新策略選擇代表性樣本進行記憶回放,保持知識多樣性。實驗表明,HyperDCM在多場景室內外數據集上優於現有持續學習方法。
持續學習在視覺導航中面臨重大挑戰,主要源於災難性遺忘以及難以適應多樣化和不斷變化的環境。為了應對這些問題,來自中國的研究團隊提出了一種名為Hyperbolic Dynamic Cluster Memory(HyperDCM)的新型記憶機制。該方法通過場景圖建模和原理性的記憶回放,顯著增強了基於擴散策略的導航能力。HyperDCM的核心創新在於將場景結構信息融入記憶管理,從而在機器人持續學習新場景時保留舊知識。
HyperDCM的工作流程分為三個關鍵步驟。首先,利用大型視覺語言模型(如CLIP或GPT-4V)從機器人採集的RGB觀測中提取語義場景三元組(例如,物體-關係-物體)。這些三元組捕捉了場景中實體之間的交互關係,為後續的圖結構表示提供了基礎。其次,通過關係圖卷積網絡(R-GCN)將這些三元組編碼為場景圖嵌入。R-GCN考慮了節點之間的邊類型和連接模式,使得嵌入能夠保留豐富的拓撲信息。為了進一步提升結構分離性和記憶保留能力,這些嵌入被投影到雙曲空間中。雙曲空間的負曲率特性天然適合表示層次結構和樹狀關係,因此場景中諸如“房間-走廊-建築”的層級關係得以更自然地建模。
在記憶回放階段,HyperDCM採用了一種動態聚類與結構敏感更新相結合的策略。具體而言,它維護一個記憶池,其中存儲了歷史場景的代表性嵌入。當機器人遇到新場景時,系統會對當前場景的嵌入進行聚類,並根據結構相似性動態調整記憶池內的樣本。結構敏感更新機制優先保留那些對舊任務至關重要的樣本,而丟棄冗餘信息。這種策略使得記憶池始終覆蓋多樣的知識分佈,有效緩解了災難性遺忘。
實驗部分,研究者在多個室內外場景數據集上進行了全面評估,包括公開的Habitat-Matterport、Gibson和自定義的户外環境。他們與EWC、SI、LC等多種經典持續學習基線進行了比較。結果顯示,HyperDCM在導航成功率、路徑長度和遺忘率等指標上均大幅領先。特別是在跨場景遷移測試中,HyperDCM的泛化性能提升超過15%,且對過去場景的導航能力保持率高達92%。這一工作為構建能夠在複雜、動態環境中持續學習的機器人導航系統提供了全新的思路,尤其在倉儲物流、家庭服務等需要適應多變環境的場景中具有廣闊的應用前景。