Crowd4D:场景感知的单目4D人群重建
Crowd4D是首个场景感知的4D人群重建框架,通过联合优化单目RGB视频中的人群与场景,利用人-场景交互代理(HSIP)解决尺度与位置对齐难题,引入人群结构相干性正则化(CSCR)提升遮挡下的时间稳定性,在复杂大场景中优于现有方法。
近日,由Hongbo Kang等人提出的Crowd4D框架正式发布,该研究旨在解决从单目RGB视频中恢复大规模场景中场景一致的四维(4D)人群运动这一极具挑战性的问题。传统的单目人群重建方法通常依赖于单平面假设,这在复杂地形下会导致不可靠的度量尺度和空间漂移。Crowd4D则首次实现了场景感知的4D人群重建,通过联合优化人群与场景,显式地利用了场景几何信息。
Crowd4D的核心创新在于其多阶段优化策略,确保了图像空间与场景空间的一致性。该框架首先从单目视频中初步估计人群和场景,然后通过联合优化不断调整,使得重建结果在整个场景中保持一致性。然而,精确的人-场景对齐(尤其是在尺度和位置上)是该任务的主要瓶颈。以往的人体和场景重建往往是解耦的,这导致了对齐困难。为此,研究者引入了人-场景交互代理(HSIP),这是一种中间表示,源自场景交互点云(SIPC)和场景交互表面(SIS)。HSIP编码了显式的场景感知几何先验,重新定义了大尺度单目4D人群重建的优化空间,使得尺度和位置对齐更加准确。
为了进一步提升遮挡情况下的时间稳定性,论文提出了人群结构相干性正则化(CSCR)。CSCR利用基于HSIP的空间先验,对局部人群邻域内的成对相对位移和方向施加软时间一致性约束。这种正则化有效地减少了因遮挡导致的抖动和不连贯,使得重建的运动更加平滑和真实。
广泛的实验表明,Crowd4D在多个复杂的大规模真实场景中一致优于现有的最先进方法。无论是在室内还是室外场景,无论是平坦地形还是崎岖地形,Crowd4D都能够稳健地重建出场景一致的四维人群运动。这项技术对于自动驾驶、体育分析、公共安全等领域具有重要的应用价值,例如在自动驾驶中准确预测行人运动,或在体育比赛中分析运动员的集体行为。
该论文已于2026年7月21日提交至arXiv(编号2607.19517),代码和数据集预计将公开发布。研究者还表示,未来将进一步优化框架的效率,并探索将其扩展到更广泛的场景类型中。