AI News HubLIVE
サイト内リライト2 分で読了

DVPSFormer:自動運転のための効率的なオンライン深度認識ビデオパノプティックセグメンテーション

DVPSFormerは、効率的な4Dシーン理解のための統一オンラインアーキテクチャであり、明示的シーン離散化(ESD)と離散連続(D2C)深度ヘッドによる単一パスの距離深度デコード、およびインスタンス追跡における時間的一貫性を活用するオンライン多数決(OMV)メカニズムを特徴とする。Cityscapes-DVPSおよびSemKITTI-DVPSベンチマークで最先端の結果を達成し、オンラインロボット知覚のための合理化されたソリューションを提供する。

ソースarXiv Computer Vision著者: Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

自動運転システムは、動的環境の理解のために、距離深度、意味セグメンテーション、インスタンス軌跡の同時推定を必要とする。既存の深度認識ビデオパノプティックセグメンテーション(DVPS)手法は、計算コストの高い多段階パイプラインやオフライン追跡に依存することが多く、リアルタイム意思決定には不向きである。この問題に対処するため、台湾大学などの研究者らはDVPSFormerを提案した。これは、効率的な4Dシーン理解のための統一オンラインアーキテクチャである。このアーキテクチャは、距離深度の推定、意味セグメンテーション、インスタンスセグメンテーションを同時に実行し、連続動画フレームにおけるインスタンスの追跡を行う。

DVPSFormerの中心的な革新は、明示的シーン離散化(ESD)メカニズムである。このメカニズムは、セグメンテーションクエリを使用して前景と背景領域を表現し、各クエリは潜在的な物体または背景部分に対応する。離散連続(D2C)深度ヘッドにより、単一のフォワードパスで距離深度をデコードすることができ、追加の深度推定ブランチが不要となる。この設計により、意味学習と幾何学習が密結合され、推論遅延が大幅に削減され、計算オーバーヘッドが低減する。

さらに、オンライン多数決(OMV)メカニズムが導入され、インスタンス追跡中に時間的一貫性を活用して分類結果を洗練する。OMVは各インスタンスの予測履歴を維持し、現在のフレームで多数決を行って最終的なクラスを決定することにより、誤検出と見逃しを削減する。実験により、OMVがインスタンス追跡の精度とロバスト性を効果的に向上させることが示された。

実験評価では、DVPSFormerはCityscapes-DVPSおよびSemKITTI-DVPSの両ベンチマークで最先端の結果を達成した。他の手法と比較して、リアルタイム性能を維持しつつ、PQ、SQ、RQなどの指標で改善を示した。このアーキテクチャは、オンラインロボット知覚のための効率的なソリューションを提供し、コードとモデルはGitHub(https://royyang0714.github.io/DVPSFormer)で公開されている。本研究は、自動運転におけるリアルタイムシーン理解の新たな道を開き、関連技術の実用展開を促進するものと期待される。