AI News HubLIVE
站内改写1 分钟阅读

GH-ESD:面向实例级视觉任务的基于假设的误差切片发现方法

GH-ESD是一种新颖的误差切片发现框架,专门针对实例级视觉任务(如目标检测和分割)设计。它通过生成与验证范式,利用大语言模型先验和视觉语言模型在实例级发现假设切片,并统计验证,从而识别出由于上下文关系和空间模式导致的系统失败。实验表明,该方法在GESD基准上显著优于现有基线。

Apple机器学习研究团队近日发表了题为《GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks》的研究论文,提出了一种针对实例级视觉任务的误差切片发现新框架。该工作由Wei Zhang、Chaoqun Wang等人共同完成,于2026年7月正式发布。

在计算机视觉领域,误差切片(error slice)是指模型在语义一致的子集上表现出的系统性失败,这些失败揭示了模型在鲁棒性和评估方面的局限性。现有的切片发现方法通常将切片建模为表示空间中的聚类或预定义属性的组合。虽然这些方法在图像级分类任务中表现良好,但难以应对目标检测、图像分割等实例级任务。在这些任务中,失败往往源于上下文关系(如物体间的交互)和空间定位模式,而非简单的属性组合。

为了解决这一挑战,GH-ESD提出了一个“生成与验证”框架。该框架将切片发现重新定义为基于假设的生成与统计验证过程。具体来说,GH-ESD首先利用大语言模型(LLM)的先验知识和空间化视觉证据,构建关系性失败假设;然后借助视觉语言模型(VLM)在实例级别发现假设切片;最后通过统计趋势分析对切片进行验证。此外,研究团队还贡献了一个新的基准数据集GESD(Grounded Error Slice Dataset),其中包含由专家定义的、空间化的检测和分割失败切片,为实例级切片发现提供了标准化的评估平台。

在GESD基准上的大量实验表明,GH-ESD在目标检测任务上一致优于现有基线方法,Precision@10从0.63提升至0.73,提升幅度达0.10。该方法同样适用于分割场景,并能够识别出可解释的切片,从而直接指导模型的可操作改进。这一研究为实例级视觉任务的失败分析提供了新的思路,有望推动更鲁棒视觉模型的发展。

GH-ESD:面向实例级视觉任务的基于假设的误差切片发现方法 | AI News Hub