AI News HubLIVE
站内改写1 分钟阅读

DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割

DVPSFormer是一种统一在线架构,用于高效4D场景理解,通过显式场景离散化(ESD)和离散到连续(D2C)深度头实现单次度量深度解码,并结合在线多数投票(OMV)机制在实例跟踪中利用时间一致性来优化分类。该方法在Cityscapes-DVPS和SemKITTI-DVPS基准上取得了最新最优结果,为在线机器人感知提供了简化解决方案。

来源arXiv Computer Vision作者: Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

自动驾驶系统需要实时理解动态环境,包括度量深度、语义分割和实例轨迹的同步估计。现有的深度感知视频全景分割(DVPS)方法通常依赖计算昂贵的多阶段流水线或离线跟踪,难以满足实时决策需求。针对这一问题,来自台湾大学等机构的研究人员提出了DVPSFormer,一种统一的在线架构,专为高效4D场景理解设计。该架构能够同时估计度量深度、执行语义分割和实例分割,并在连续视频帧中跟踪实例。

DVPSFormer的核心创新在于显式场景离散化(ESD)机制。该机制利用分割查询表示前景和背景区域,每个查询对应一个潜在的物体或背景部分。通过离散到连续(D2C)深度头,系统在单次前向传播中解码出度量深度,无需额外的深度估计分支。这种设计紧密耦合了语义与几何学习,显著降低了推理延迟,并减少了计算开销。

此外,研究人员引入了在线多数投票(OMV)机制,在实例跟踪过程中利用时间一致性来细化分类结果。OMV维护每个实例的预测历史,并在当前帧中多数投票决定最终类别,从而减少误检和漏检。实验表明,OMV有效提升了实例跟踪的准确率和鲁棒性。

在实验评估中,DVPSFormer在Cityscapes-DVPS和SemKITTI-DVPS两个公开基准上均取得了最先进的结果。与其他方法相比,它在保持实时性能的同时,在PQ、SQ、RQ等指标上均有所提升。该架构为在线机器人感知提供了一种精炼高效的解决方案,其代码和模型已在GitHub上开源,网址为https://royyang0714.github.io/DVPSFormer。这项研究为自动驾驶中的实时场景理解开辟了新的途径,有望推动相关技术的实际部署。