DVPSFormer:面向自動駕駛的高效線上深度感知影片全景分割
DVPSFormer是一種統一線上架構,用於高效4D場景理解,透過顯式場景離散化(ESD)和離散到連續(D2C)深度頭實現單次度量深度解碼,並結合線上多數投票(OMV)機制在例項跟蹤中利用時間一致性來最佳化分類。該方法在Cityscapes-DVPS和SemKITTI-DVPS基準上取得了最新最優結果,為線上機器人感知提供了簡化解決方案。
自動駕駛系統需要即時理解動態環境,包括度量深度、語義分割和例項軌跡的同步估計。現有的深度感知影片全景分割(DVPS)方法通常依賴計算昂貴的多階段流水線或離線跟蹤,難以滿足即時決策需求。針對這一問題,來自臺灣大學等機構的研究人員提出了DVPSFormer,一種統一的線上架構,專為高效4D場景理解設計。該架構能夠同時估計度量深度、執行語義分割和例項分割,並在連續影片幀中跟蹤例項。
DVPSFormer的核心創新在於顯式場景離散化(ESD)機制。該機制利用分割查詢表示前景和背景區域,每個查詢對應一個潛在的物體或背景部分。透過離散到連續(D2C)深度頭,系統在單次前向傳播中解碼出度量深度,無需額外的深度估計分支。這種設計緊密耦合了語義與幾何學習,顯著降低了推理延遲,並減少了計算開銷。
此外,研究人員引入了線上多數投票(OMV)機制,在例項跟蹤過程中利用時間一致性來細化分類結果。OMV維護每個例項的預測歷史,並在當前幀中多數投票決定最終類別,從而減少誤檢和漏檢。實驗表明,OMV有效提升了例項跟蹤的準確率和魯棒性。
在實驗評估中,DVPSFormer在Cityscapes-DVPS和SemKITTI-DVPS兩個公開基準上均取得了最先進的結果。與其他方法相比,它在保持即時效能的同時,在PQ、SQ、RQ等指標上均有所提升。該架構為線上機器人感知提供了一種精煉高效的解決方案,其程式碼和模型已在GitHub上開源,網址為https://royyang0714.github.io/DVPSFormer。這項研究為自動駕駛中的即時場景理解開闢了新的途徑,有望推動相關技術的實際部署。