AI News HubLIVE
站内改写1 分钟阅读

无需训练的开放词汇3D点云分割在广义少样本基准上的突破

该研究提出一种完全无需训练的开放词汇3D点云分割方法,利用冻结的视觉语言模型(RegionPLC)和提示概念分割器(SAM3)通过跨视图一致性实现广义少样本分割,在ScanNet200和ScanNet++基准上显著提升了新类分割性能,且无需任何训练或少样本支持。

来源arXiv Computer Vision作者: Silas kwabla Gah, Ebenezer Owusu

广义少样本3D点云分割(GFS-PCS)是一项具有挑战性的任务,要求模型能够同时分割训练阶段见过的基类以及从未见过的新类。现有的最先进方法通常通过融合一个密集但包含噪声的3D视觉语言先验与少量的支持样本来实现新类分割。然而,这种策略依赖于基类3D标签、逐期训练以及支持样本的人工标注,成本高昂且难以扩展。

在本研究中,作者探索了一个大胆的问题:在完全没有训练、没有3D标签、甚至没有少量支持样本的情况下,相同的融合策略能达到怎样的性能?为此,他们提出了一种完全无需训练的开放词汇3D点云分割管道。该方法将冻结的3D视觉语言模型RegionPLC作为密集先验,与另一个冻结的可提示概念分割器SAM3相结合。SAM3仅通过新类的名称进行提示,并从带有姿态信息的RGB视图中提取特征。两者的融合通过跨视图一致性实现:只有当足够多的视图对某个点达成一致时,才将其标记为新类。这种设计完全避免了任何训练过程或标注需求。

在ScanNet200 GFS-PCS基准测试中,该无需训练的开放词汇管道在基类精度仅下降0.5%的情况下,将新类的平均交并比(mIoU)提升了2.6个百分点,恢复了与新类最先进方法之间33%的差距。在更具挑战性的ScanNet++基准上,密集先验对新类的性能原本较弱,但同一管道几乎使新类mIoU翻倍(从16.2提升至31.9,提升15.7),同时基类成本仅增加1.7,调和平均值从21.5提升至31.1。

研究还发现,将少量支持样本作为融合门控或原型密集分类器注入管道,不仅没有带来任何增益,反而由于分类器的引入导致性能下降。这一发现解释了为何该方法完全不需要支持样本,同时也展示了跨视图一致性本身作为一种强大的学习信号,足以在零训练和零标注条件下实现有效的开放词汇分割。该工作为3D点云分割领域的少样本学习提供了新的视角,有望降低实际应用中对大规模标注数据的需求。