AI News HubLIVE
站內改寫1 分鐘閱讀

無需訓練的開放詞彙3D點雲分割在廣義少樣本基準上的突破

該研究提出一種完全無需訓練的開放詞彙3D點雲分割方法,利用凍結的視覺語言模型(RegionPLC)和提示概念分割器(SAM3)透過跨檢視一致性實現廣義少樣本分割,在ScanNet200和ScanNet++基準上顯著提升了新類分割效能,且無需任何訓練或少樣本支援。

來源arXiv Computer Vision作者: Silas kwabla Gah, Ebenezer Owusu

廣義少樣本3D點雲分割(GFS-PCS)是一項具有挑戰性的任務,要求模型能夠同時分割訓練階段見過的基類以及從未見過的新類。現有的最先進方法通常透過融合一個密集但包含噪聲的3D視覺語言先驗與少量的支援樣本來實現新類分割。然而,這種策略依賴於基類3D標籤、逐期訓練以及支援樣本的人工標註,成本高昂且難以擴充套件。

在本研究中,作者探索了一個大膽的問題:在完全沒有訓練、沒有3D標籤、甚至沒有少量支援樣本的情況下,相同的融合策略能達到怎樣的效能?為此,他們提出了一種完全無需訓練的開放詞彙3D點雲分割管道。該方法將凍結的3D視覺語言模型RegionPLC作為密集先驗,與另一個凍結的可提示概念分割器SAM3相結合。SAM3僅透過新類的名稱進行提示,並從帶有姿態資訊的RGB檢視中提取特徵。兩者的融合透過跨檢視一致性實現:只有當足夠多的檢視對某個點達成一致時,才將其標記為新類。這種設計完全避免了任何訓練過程或標註需求。

在ScanNet200 GFS-PCS基準測試中,該無需訓練的開放詞彙管道在基類精度僅下降0.5%的情況下,將新類的平均交併比(mIoU)提升了2.6個百分點,恢復了與新類最先進方法之間33%的差距。在更具挑戰性的ScanNet++基準上,密集先驗對新類的效能原本較弱,但同一管道幾乎使新類mIoU翻倍(從16.2提升至31.9,提升15.7),同時基類成本僅增加1.7,調和平均值從21.5提升至31.1。

研究還發現,將少量支援樣本作為融合門控或原型密集分類器注入管道,不僅沒有帶來任何增益,反而由於分類器的引入導致效能下降。這一發現解釋了為何該方法完全不需要支援樣本,同時也展示了跨檢視一致性本身作為一種強大的學習訊號,足以在零訓練和零標註條件下實現有效的開放詞彙分割。該工作為3D點雲分割領域的少樣本學習提供了新的視角,有望降低實際應用中對大規模標註資料的需求。