AI News HubLIVE
站内改写2 分钟阅读

基于概念的视觉反事实解释与扩散模型

本文提出C-VCE,一种将分类器直接构建到生成模型中的扩散框架,通过概念瓶颈层生成反事实图像,无需依赖外部噪声鲁棒分类器。C-VCE允许用户在采样过程中切换语义概念,并保持图像其他部分不变,同时添加正则化器平衡预测改变与原始相似性。在CelebA等基准测试中,C-VCE在翻转率相当或更优的情况下,生成的反事实图像在视觉上更接近输入且失真更小。

来源arXiv AI作者: Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

视觉反事实解释是人工智能可解释性领域的一个重要研究方向,它的目标是回答一个关键问题:“对这张图像进行最小改动,能否改变模型的预测?”这一任务在医学影像诊断、自动驾驶等安全关键领域的应用日益广泛,因为这些场景中模型的决策通常需要可验证和可解释,而反事实图像可以提供具体的“如果……会怎样?”的假设分析。

现有的基于扩散模型的方法虽然能够生成逼真的图像编辑,但它们往往依赖于外部训练好的分类器来指导编辑过程。这些外部分类器必须在不同噪声水平下的图像上保持稳健,这使得整个系统变得脆弱且难以在实际部署中提供可靠的解释。问题的根源在于,分类器与生成模型是分离的,分类器需要精确处理噪声图像,而扩散模型在采样过程中又会产生噪声,从而形成一种不稳定的依赖。

为了克服这一挑战,由Yassine Oueslati等四位作者组成的团队提出了C-VCE(Concept-based Visual Counterfactual Explanations),这是一种全新的扩散框架,其核心创新在于将分类器直接构建到生成模型内部,通过一个概念瓶颈层来实现。概念瓶颈层允许模型利用人类可解释的语义特征(例如“有胡须”、“戴眼镜”、“微笑”等)来引导反事实图像的生成,而不是依赖一个单独的外部噪声鲁棒分类器进行像素级编辑。这种设计从根本上消除了对额外分类器的依赖,使整个流程更加简洁和稳定。

C-VCE的工作流程非常直观:用户在采样过程中可以自由地打开或关闭某些语义概念(例如从“微笑”切换到“不微笑”),模型随后会仅对图像中与该概念相关的区域进行最小幅度的调整,同时保留图像的其余部分,并尊重不同特征之间的相关性(例如改变发型时可能也会影响发色等关联属性)。为了确保编辑足够小且可控,研究人员引入了两个关键组件:一个简单的概率正则化器,用于在“改变预测”和“保持接近原始图像”之间取得平衡;以及一个基于梯度的掩码,用于将修改限制在最相关的图像区域,防止对其他无关部分造成意外扰动。

在CelebA人脸数据集等基准测试上,C-VCE表现出了优异的性能。它能够在达到相当甚至更高的预测翻转率的同时,生成的反事实图像在视觉上更接近原始输入,并且失真程度显著低于那些依赖独立噪声图像分类器的基线方法。更重要的是,C-VCE生成的图像更加自然,避免了因外部分类器不稳定而导致的异常编辑。

这些特性使得C-VCE成为视觉系统领域一个非常实用的工具。用户无需信任额外的噪声鲁棒分类器,即可直接通过操作高层语义概念获取具体的反事实图像,从而对模型的决策边界形成更直观的理解。更广泛来看,这项研究结果表明,暴露并控制生成模型的内部概念层是让强大的深度生成模型变得更加可理解和安全的一个非常有前景的方向。该论文已被第四届世界可解释人工智能大会(XAI 2026)接收,计划于2026年正式发表。