AI News HubLIVE
站内改写1 分钟阅读

TraceCLIP:从补丁到CLS贡献中恢复局部语义

TraceCLIP是一种无需训练的新框架,通过从CLIP的CLS注意力输出中提取补丁特定项,恢复潜藏的局部语义证据,并利用语义测地拓扑门校准最终层的补丁亲和度,实现零样本语义分割的改进。在八个基准测试上,平均mIoU提升1.3至4.5个点,无需额外训练或外部模型。

来源arXiv Computer Vision作者: Xinran Liu, Shouqian Shi, Yutong Chen, Ge Wang, Xin-Wei Yao, Sheng Zhong

arXiv于2026年7月28日发布了一项名为TraceCLIP的研究,提出了一种无需训练即可从预训练视觉语言模型CLIP中恢复局部语义信息的创新框架。该框架的核心在于巧妙利用CLIP模型中的CLS(分类)标记注意力输出,通过精确隔离每个图像补丁对CLS标记的特定贡献,成功提取出原本被全局表示所掩盖的局部语义证据。

传统的CLIP模型通过大规模对比学习将图像和文本映射到共享的嵌入空间,但其图像级目标函数主要对齐文本与全局表示,导致局部视觉-语言对应关系仅受到间接约束。先前的方法要么需要额外的监督信号、外部模型或任务特定微调,要么在不进行训练的情况下仅从现有补丁特征中恢复密集响应,未能深入探索CLIP内部局部语义的可达性。TraceCLIP填补了这一空白。

该方法首先从CLS注意力输出中分解出每个补丁的特定贡献,从而获得具有强局部语义判别能力的贡献特征。这些贡献特征随后被转换为一个语义测地拓扑门(semantic-geodesic topology gate),用于校准最后一层补丁之间的亲和度,进而用于密集特征重构。实验表明,这些贡献特征在文本条件下的空间对齐方面表现出色,能够准确捕捉到与语言概念对应的局部视觉区域。

在八个零样本语义分割基准测试中,TraceCLIP在多种骨干网络和背景设置下,平均交并比(mIoU)相较于先前最强的无需训练方法提升了1.3至4.5个百分点。这一提升无需任何额外的训练、外部视觉基础模型或区域级监督,充分展示了其高效性和通用性。研究结果还表明,即使在全局对齐的表示中,空间局部化的语义信息仍然可以通过内部构造被有效访问,这为未来视觉语言模型的改进提供了新的思路。

TraceCLIP的发表标志着无需训练即可从CLIP中挖掘局部语义信息成为可能,有望在对象定位、区域识别和开放词汇语义分割等密集视觉语言理解任务中发挥重要作用。