SwordBench:评估图像表示引导的正交性
SwordBench是一个新的基准测试,用于评估视觉模型在推理时对图像表示进行引导(steering)的效果。它引入了跨概念鲁棒性和附带损害两个新指标,以衡量正交化操作的影响。实验发现,线性SVM虽然具有较好的分离性和正交性,但无法实现零附带损害,而稀疏自编码器表现更优。在简单场景中,标准基线和优化方法均无法实现完美引导。代码即将在GitHub上开源。
近年来,AI模型的可解释性和安全性成为研究热点,其中在推理时对模型表示进行引导(steering)以纠正预测是一种关键方法。然而,现有的评估协议主要局限于模糊的语言建模任务,缺乏对视觉模型图像表示引导的系统性评估。为了填补这一空白,研究者提出了SwordBench,一个专门用于评估视觉模型图像表示引导的基准测试。
SwordBench支持多种主干网络(如ResNet、ViT等)和概念移除任务,提供了一个统一的评估套件,使得不同方法之间的比较更加公平和全面。更重要的是,它引入了两个新的评估概念,用于揭示概念激活向量正交化在实用引导中的二阶效应:跨概念鲁棒性(cross-concept robustness)衡量在对输入进行其他概念正交化后,概念检测性能的稳定性;附带损害(collateral damage)则量化引导是否无意中影响模型在不含偏差输入上的下游任务性能。这两个指标共同提供了对引导方法更深入的洞察。
实验结果表明,尽管线性支持向量机(SVM)在分离性和正交性上表现出色,但它无法实现零附带损害,常常落后于稀疏自编码器。在更简单的场景中,标准基线和基于优化的方法都未能达到完美引导。研究团队表示,相关源代码将在GitHub上尽快公开,以促进该领域的进一步研究和发展。