EditCLEVR:面向对象中心表示组合忠实性的配对场景干预基准
EditCLEVR是一个新的基准测试,用于评估对象中心学习中的组合忠实性。它通过配对场景干预(已知属性更改或无更改)来测试模型在语义编辑下是否正确改变对象表示。该基准引入场景图干预准确率(SGIA)和Delta-SGIA指标,分别要求完整后场景预测正确和仅检测单一变化模式。基线评估表明,即使使用真实掩码,组合分布外性能下降依然存在,仅凭局部性或稳定性可能会高估语义忠实性。
对象中心学习(Object-centric learning)旨在将场景表示为一系列对象的组合,每个对象具有可重用的属性。这种表示对于组合泛化至关重要,但现有评估方法(如分割精度、单图像因子预测或下游任务准确率)并未直接测试对象表示在受控语义编辑下的行为是否正确。为了填补这一空白,来自加州大学伯克利分校的研究人员提出了EditCLEVR基准测试,相关论文于2026年7月19日提交至arXiv。
EditCLEVR基于CLEVR风格的渲染图像,构建了成对的before/after场景。每个示例包含两幅渲染图,它们具有相同的对象索引和场景布局,但其中一幅对某个已知对象进行恰好一个已知属性的编辑(例如改变颜色或形状),另一幅则是不做任何编辑的重新渲染,用于测量模型自身的漂移。这种方式可以精确地测试模型在语义干预下的表示变化是否忠实于预期编辑。
该基准引入了两种新的评估指标:场景图干预准确率(SGIA)和Delta-SGIA。SGIA要求模型对编辑后场景的完整预测正确,并且从before到after的唯一语义变化必须是预期的对象因子编辑。Delta-SGIA则作为辅助诊断,仅检查单一变化模式,而不要求完整后场景图正确。这些指标覆盖分布内和组合分布外(OOD)场景,允许分别评估编码空间中的表示移动和解码对象属性的正确性。
基线实验使用了多种模型,包括基于真实掩码的骨干网络、学习槽模型、SAM 2结合冻结ViT模型以及一种掩码特征混合模型。结果表明,在CoGenT-OOD-core场景下,即使使用真实实例掩码,性能下降依然存在;掩码来源只能部分解释原生性能,且仅凭局部性或稳定性指标可能会夸大语义忠实性。这些发现表明,现有评估方法可能高估了对象中心模型的组合能力,EditCLEVR提供了更严格的测试。
EditCLEVR的代码已在GitHub上开源(https://github.com/torux-bughunter/EditCLEVR),为对象中心学习领域提供了一个标准化、诊断性的评估工具。未来工作可以在此基础上改进模型的组合忠实性。