AI News HubLIVE
サイト内リライト2 分で読了

訓練不要なオープンボキャブラリ3D点群セグメンテーションの一般化少数ショットベンチマークへの応用

本研究は、凍結された視覚言語モデル(RegionPLC)とプロンプト可能な概念セグメンター(SAM3)をクロスビュー一貫性で融合し、訓練や少数ショットサポートを一切必要としないオープンボキャブラリ3D点群セグメンテーション手法を提案。ScanNet200およびScanNet++ベンチマークで新規クラスの性能を大幅に向上させた。

ソースarXiv Computer Vision著者: Silas kwabla Gah, Ebenezer Owusu

一般化少数ショット3D点群セグメンテーション(GFS-PCS)は、モデルが訓練時に見たベースクラスと、未見の新規クラスの両方をセグメンテーションすることを要求するタスクである。従来の最先端手法は、密だがノイズの多い3D視覚言語事前分布と少数ショットサポートを融合することで新規クラスを認識するが、その代償としてベースクラスの3Dラベル、エピソードごとの訓練、およびサポートアノテーションを必要とする。

本研究では、これらの一切なしで同じ融合がどこまで可能かを問う:訓練なし、3Dラベルなし、少数ショットサポートさえもなし。著者らは、凍結された3D視覚言語モデルRegionPLCを密な事前分布として、凍結されたプロンプト可能な概念セグメンターSAM3と組み合わせる。SAM3は新規クラス名のみでプロンプトされ、姿勢情報付きRGBビューから特徴を抽出する。両者の融合はクロスビュー一貫性によって行われる:ある点が新規クラスと見なされるのは、その点を観測する十分な数のビューが一致した場合のみである。この設計は訓練やアノテーションを完全に排除する。

ScanNet200 GFS-PCSベンチマークでは、この完全に訓練不要なオープンボキャブラリパイプラインは、ベース精度を0.5%以内に抑えながら、新規クラスの平均交差比(mIoU)を2.6向上させ、訓練済みSOTAとのギャップの33%を回復した。より難しいScanNet++ベンチマークでは、密な事前分布が新規クラスに対して弱いにもかかわらず、同じパイプラインは新規クラスmIoUをほぼ倍増(16.2から31.9へ+15.7)させ、ベースコスト1.7で調和平均を21.5から31.1に引き上げた。

さらに、少数ショットサポートを融合ゲートやプロトタイプ密分類器としてパイプラインに注入しても、一貫性のみの場合に比べて利点はなく、むしろ分類器によって性能が低下することが示された。この発見は、この手法がサポートを全く必要としない理由を説明し、クロスビュー一貫性自体が強力な学習信号として機能し、ゼロ訓練・ゼロラベル条件下でも効果的なオープンボキャブラリセグメンテーションを可能にすることを示している。本研究成果は、3D点群セグメンテーションにおける少数ショット学習に新たな視点を提供し、大規模なラベル付きデータへの依存を低減する可能性を秘めている。