AI News HubLIVE
站内改写2 分钟阅读

qZACH-ViT:基于递归归因稳定优化的量化感知内在解释

本文提出qZACH-ViT,一种量化感知的紧凑型医学图像分类器,结合零令牌、无位置ZACH-ViT骨干网络和递归内在补丁级类别证据。同时引入递归归因稳定优化(RASO),通过归一化匹配分类和归因梯度并移除冲突成分,提高模型可解释性。在7个MedMNIST数据集上的实验表明,混合精度INT8 qZACH-ViT在指标上超越FP32基线,模型缩小70%,CPU速度提升1.41–2.39倍,预测一致性达99.975%。RASO显著降低充分性误差并增强输入噪声稳定性。

来源arXiv Machine Learning作者: Athanasios Angelakis

在医学影像分类领域,紧凑型模型的效率和可解释性往往难以兼顾。近日,一项名为qZACH-ViT的研究提出了一种量化感知的紧凑型医学图像分类器,通过创新的递归归因稳定优化(RASO)技术,在保持高性能的同时显著提升了模型的可解释性。该研究由Athanasios Angelakis等人完成,论文已提交至arXiv(编号2607.15421)。

qZACH-ViT是ZACH-ViT骨干网络的量化感知扩展版本。ZACH-ViT本身是一种无需类别令牌(CLS-token)和无位置编码的视觉Transformer架构,通过递归的内在补丁级类别证据实现解释。qZACH-ViT在此基础上引入量化感知训练,使得模型能够部署为混合精度INT8格式,具体表现为将210个检查点转换为包含16个有符号INT8 MatMulInteger投影(INT32累加)的可执行ONNX图。

研究团队还提出了递归归因稳定优化(RASO),该方法通过归一化匹配分类梯度和归因梯度,并移除与分类相冲突的归因成分,从而提升解释的稳定性和质量。在实验中,研究人员在七个MedMNIST数据集上设置了四种受控条件,每类仅使用50张训练图像和十个固定随机种子,共计完成280次运行。结果表明,采用Adam优化器的混合精度INT8 qZACH-ViT在所有数据集上均优于FP32 ZACH-ViT基线,平均配对增益为0.0313(按数据集特定主要指标计算);而结合RASO后,平均增益进一步达到0.0368。

在模型部署方面,ONNX工具体积比原始检查点缩小70%,端到端CPU推理速度提升1.41倍(单线程)和2.39倍(四线程)。在964,920次原模型到INT8模型的测试比较中,预测一致性高达99.9751%,主要指标的平均绝对变化仅为0.000133,最大变化为0.004386。此外,在3,600对匹配的内在归因图中,平均余弦相似度为0.999955,平均秩相关性为0.9944,平均前10%重叠率为0.9692。

值得注意的是,RASO在充分性误差和输入噪声稳定性方面显著优于使用相同归因损失的Adam,但并非在所有预测或可解释人工智能(XAI)指标上都占优。这些结果确立了qZACH-ViT作为可部署的紧凑型内在可解释模型,而RASO则作为一种针对稳定性的优化程序。该研究为医学图像分类的实用化部署提供了新的思路,平衡了效率、可解释性和准确性。