对比多模态超图推理用于三维人群网格恢复
提出对比多模态超图推理方法,结合语义、几何和姿态线索解决多人3D重建中的遮挡和深度模糊问题。通过超图对比学习实现全局上下文传播,在多个基准上达到最优性能。
近日,来自中国科学院等机构的研究人员提出了一种名为对比多模态超图推理(Contrastive Multi-modal Hypergraph Reasoning,简称CoMHR)的新方法,用于三维人群网格恢复。该工作旨在解决多人3D重建中的核心难题——严重遮挡和深度模糊。目前主流方法通常依赖单一模态输入(如仅RGB图像),这导致缺乏几何引导;同时,这些方法往往独立重建每个个体,忽略了群体上下文对于消除歧义的关键作用。
CoMHR方法通过协同利用语义、几何和姿态线索来提升重建鲁棒性。具体来说,研究团队首先结合RGB特征、几何先验以及遮挡感知的不完整姿态,初始化鲁棒的节点表示。为了提供全局空间参考,他们引入了一个骨盆深度指示器作为空间锚点,将视觉特征与度量尺度无关的深度顺序对齐。接着,构建了一个共享拓扑的超图结构,该结构超越了传统的成对约束,能够建模高阶人群动态,例如多人之间的遮挡关系和相互作用的二阶或更高阶信息。
在特征融合方面,研究团队设计了基于超图的对比学习方案。该方案同时增强模态内判别性(即同一模态不同样本的可区分性)和模态间正交性(即不同模态特征之间的独立性)。这种对比学习机制使得网络能够有效传播全局上下文,即使在严重遮挡下也能推断出缺失的信息。
在Panoptic和GigaCrowd两个公开基准上进行了大量实验,结果表明CoMHR方法达到了新的最优性能。具体而言,在Panoptic数据集的多个场景中,CoMHR在平均关节位置误差、网格顶点误差等指标上均优于现有方法;在GigaCrowd这一大规模人群数据集上,CoMHR同样展现出卓越的重建质量和遮挡处理能力。研究团队已公开代码和预训练模型,便于他人复现和进一步研究。该成果已被ICME 2026接收,为计算机视觉与多媒体领域提供了新的思路。