AI News HubLIVE
サイト内リライト2 分で読了

HyperDCM: 双曲空間における動的クラスタメモリリプレイによる連続ロボットナビゲーション

視覚ナビゲーションにおける破滅的忘却に対処するため、研究者らは構造認識型メモリ機構HyperDCMを提案する。大規模視覚言語モデルを用いてシーン三つ組を抽出し、R-GCNでシーングラフ埋め込みに符号化し、双曲空間に投影して構造的分離性を高める。動的クラスタリングと構造に敏感な更新戦略により代表サンプルを選択してリプレイし、知識の多様性を維持する。マルチシーンデータセットでの実験により、ベースラインと比較して優れた保持と一般化を示した。

ソースarXiv Robotics著者: Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei

連続学習は視覚ナビゲーションにおいて、破滅的忘却や多様で変化する環境への適応の難しさから大きな課題となっています。これらの問題に対処するため、中国の研究チームはHyperbolic Dynamic Cluster Memory(HyperDCM)と呼ばれる新しい記憶機構を提案しました。本手法は、シーングラフモデリングと原理に基づいた記憶リプレイを通じて、拡散ポリシーに基づくナビゲーションを強化します。HyperDCMの核心は、シーンの構造情報を記憶管理に組み込むことで、ロボットが新しいシーンを学習しても古い知識を保持できるようにすることです。

HyperDCMのワークフローは3つの主要なステップから構成されます。まず、大規模視覚言語モデル(CLIPやGPT-4Vなど)を使用して、ロボットが収集したRGB観測から意味的なシーン三つ組(例:物体-関係-物体)を抽出します。これらの三つ組は、シーン内のエンティティ間の相互作用関係を捉え、後のグラフ構造表現の基盤となります。次に、Relational Graph Convolutional Network(R-GCN)を介してこれらの三つ組をシーングラフ埋め込みに符号化します。R-GCNはノード間のエッジタイプと接続パターンを考慮するため、埋め込みは豊富なトポロジー情報を保持できます。さらに、構造的分離性と記憶保持能力を高めるため、埋め込みは双曲空間に投影されます。双曲空間の負の曲率特性は階層構造や木構造を自然に表現するのに適しており、「部屋-廊下-建物」のようなシーンの階層関係をより効果的にモデル化できます。

記憶リプレイの段階では、HyperDCMは動的クラスタリングと構造に敏感な更新戦略を組み合わせて採用します。具体的には、過去のシーンの代表的な埋め込みを保存するメモリプールを維持します。ロボットが新しいシーンに遭遇すると、システムは現在のシーンの埋め込みをクラスタリングし、構造的類似性に基づいてメモリプール内のサンプルを動的に調整します。構造に敏感な更新メカニズムは、古いタスクにとって重要なサンプルを優先的に保持し、冗長な情報を破棄します。この戦略により、メモリプールは常に多様な知識分布をカバーし、破滅的忘却を効果的に軽減します。

実験では、Habitat-Matterport、Gibson、およびカスタム屋外環境を含む複数の屋内・屋外データセットで包括的な評価が行われました。EWC、SI、LCなどの代表的な連続学習ベースラインと比較した結果、HyperDCMはナビゲーション成功率、経路長、忘却率などの指標で大幅に優れていることが示されました。特に、シーン間の転送テストでは、HyperDCMの一般化性能が15%以上向上し、過去のシーンのナビゲーション能力保持率は92%に達しました。この研究は、倉庫物流や家庭サービスなど、変化する環境に適応する必要があるロボットナビゲーションシステムの構築に新たな道を開くものです。