HyperDCM:双曲空间中的动态聚类记忆回放实现跨场景持续机器人导航
针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。
持续学习在视觉导航中面临重大挑战,主要源于灾难性遗忘以及难以适应多样化和不断变化的环境。为了应对这些问题,来自中国的研究团队提出了一种名为Hyperbolic Dynamic Cluster Memory(HyperDCM)的新型记忆机制。该方法通过场景图建模和原理性的记忆回放,显著增强了基于扩散策略的导航能力。HyperDCM的核心创新在于将场景结构信息融入记忆管理,从而在机器人持续学习新场景时保留旧知识。
HyperDCM的工作流程分为三个关键步骤。首先,利用大型视觉语言模型(如CLIP或GPT-4V)从机器人采集的RGB观测中提取语义场景三元组(例如,物体-关系-物体)。这些三元组捕捉了场景中实体之间的交互关系,为后续的图结构表示提供了基础。其次,通过关系图卷积网络(R-GCN)将这些三元组编码为场景图嵌入。R-GCN考虑了节点之间的边类型和连接模式,使得嵌入能够保留丰富的拓扑信息。为了进一步提升结构分离性和记忆保留能力,这些嵌入被投影到双曲空间中。双曲空间的负曲率特性天然适合表示层次结构和树状关系,因此场景中诸如“房间-走廊-建筑”的层级关系得以更自然地建模。
在记忆回放阶段,HyperDCM采用了一种动态聚类与结构敏感更新相结合的策略。具体而言,它维护一个记忆池,其中存储了历史场景的代表性嵌入。当机器人遇到新场景时,系统会对当前场景的嵌入进行聚类,并根据结构相似性动态调整记忆池内的样本。结构敏感更新机制优先保留那些对旧任务至关重要的样本,而丢弃冗余信息。这种策略使得记忆池始终覆盖多样的知识分布,有效缓解了灾难性遗忘。
实验部分,研究者在多个室内外场景数据集上进行了全面评估,包括公开的Habitat-Matterport、Gibson和自定义的户外环境。他们与EWC、SI、LC等多种经典持续学习基线进行了比较。结果显示,HyperDCM在导航成功率、路径长度和遗忘率等指标上均大幅领先。特别是在跨场景迁移测试中,HyperDCM的泛化性能提升超过15%,且对过去场景的导航能力保持率高达92%。这一工作为构建能够在复杂、动态环境中持续学习的机器人导航系统提供了全新的思路,尤其在仓储物流、家庭服务等需要适应多变环境的场景中具有广阔的应用前景。