AI News HubLIVE
站内改写2 分钟阅读

共享语义码本蒸馏:面向非配对跨模态医学分类

跨模态知识蒸馏常因医学影像模态之间的非配对问题而失效。该研究提出共享语义码本蒸馏(SSCD),通过共享的离散码本将图像表示为语义分布,并全局与类别条件地对齐教师和学生模态,无需配对样本或直接比较原始特征。在眼底与胸部X光两个任务上,SSCD显著提升学生模型性能并超越现有基线。

来源arXiv Computer Vision作者: Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

跨模态知识蒸馏的目标是将诊断知识从性能强大但计算成本较高的模态(教师)迁移到更轻量、更适合部署的模态(学生)。在医学影像分析中,这一过程常常面临一个关键障碍:不同模态的数据往往是非配对的。所谓非配对,是指两类影像可能来自不同的患者队列,且它们在特征空间上几何不兼容。在这种情况下,常见的实例级蒸馏方法不再成立,而直接进行特征匹配也缺乏可靠性。为了解决这一难题,研究团队提出了共享语义码本蒸馏(SSCD),这是一种不依赖配对样本的跨模态知识迁移新方法。

SSCD的核心思想是引入一个与模态无关的共享离散码本。具体来说,每一张图像都被映射为该码本词汇表上的一个概率分布,而不是直接使用原始特征。通过这种方式,教师和学生模态可以在同一个语义空间中进行比较。知识迁移通过全局对齐和类别条件对齐两种方式实现:全局对齐让整体分布趋于一致,而类别条件对齐则针对每个类别分别进行匹配,从而保留类别相关的判别信息。整个过程不需要配对样本,也不要求两种模态的原始特征具有可比性。

在训练过程中,码本并非静态不变的,而是通过指数移动平均(EMA)在线更新,以适应不断变化的特征分布。同时,为了确保码本中的各个码字都被充分利用,研究采用了熵正则化来鼓励分布更加均匀,并通过死码重启机制重新激活那些长期未被使用的码字。这两种机制共同作用,有效避免了码本退化问题。到了推理阶段,所有教师侧模块以及码本本身都会被丢弃,系统只需要保留学生编码器和分类器,因此在实际部署时不会增加任何额外的计算负担。

研究在两个具有代表性的非配对跨模态医学分类任务上进行了验证:一是OCT到眼底图像的视网膜疾病分类,二是CT到胸部X光的肺炎分类。实验结果表明,SSCD在这两个任务上都取得了显著提升。具体而言,学生模型的macro-F1分数从64.5提高到70.2(OCT到眼底),以及从73.8提高到76.3(CT到胸部X光)。在所有参与对比的蒸馏基线中,SSCD均取得了最优性能,展示了其处理非配对医学影像数据的强大能力。

目前,研究团队已经公开了论文的代码和预训练模型,资源可以在GitHub上获取。论文共16页,包含2张图和4张表格,已于2026年7月29日提交至arXiv,编号为2607.27357,涉及计算机视觉与模式识别(cs.CV)以及图像与视频处理(eess.IV)两个领域。这项研究为非配对跨模态医学分类提供了一种实用且高效的解决方案,有望推动相关临床应用的发展。