多模态持续学习中的模态贡献漂移正则化
多模态持续学习(MMCL)旨在从多模态数据中学习新知识并保留旧知识。现有方法多聚焦于跨模态表征对齐或语义相似性,却忽视了各模态相对贡献及其交互在增量任务中是否保持稳定。本文将该决策层面的变化定义为模态贡献漂移(MCD),并提出MCD分数进行量化。基于理论分析,作者提出持续模态贡献漂移正则化(CMCDR)方法,包含基于回放和无回放两种版本,通过模态子集干预作为探针,约束旧任务模态贡献结构的变化。实验验证了该方法在多模态类增量学习和持续视觉问答任务上的有效性与泛化性。
多模态持续学习(MMCL)旨在使模型在持续从多模态数据中学习新知识的同时,避免遗忘已学到的知识。现有缓解灾难性遗忘的方法通常侧重于跨模态表征对齐或语义相似性,然而这些方法忽略了一个关键问题:在增量学习过程中,不同模态的相对贡献以及模态间的交互是否能够保持稳定。这种在决策层面的变化,正是本文关注的核心。
本文将上述决策层面的偏移定义为模态贡献漂移(Modality Contribution Drift, MCD),并提出了一种量化指标——MCD分数。该分数通过在模态子集上施加受控干预,结合贡献强度变化与相对依赖变化,从而系统性地衡量模态贡献结构的漂移程度。理论分析与经验研究进一步揭示了现有MMCL方法为何不能可靠地缓解这种漂移的原因。
为解决这一问题,研究团队提出了持续模态贡献漂移正则化(Continual Modality Contribution Drift Regularization, CMCDR)方法。其核心思想是保留先前学习任务中模态贡献的结构性特征。由于不同的MMCL设置中,旧样本(exemplar)是否可用存在差异,CMCDR设计了两种版本:基于回放的版本(replay-based)和无回放的版本(replay-free)。
在基于回放的版本中,算法将模态子集干预作为诊断探针,作用于存储的旧样本上。通过比较当前模型与冻结的旧模型在这些样本上的贡献分布,对旧样本的模态特定贡献和交互贡献施加约束,从而抑制漂移。而在无回放版本中,由于无法访问旧样本,算法利用当前任务样本作为探针,通过蒸馏冻结模型中旧任务的贡献响应,以正则化当前观测到的贡献分布。这种方法在缺乏样本回放的情况下,依然能够保持模态贡献结构的稳定性。
为验证CMCDR的有效性和通用性,研究者在多模态类增量学习(class-incremental learning)和持续视觉问答(continual visual question answering)两个任务上进行了实验。实验结果表明,CMCDR在这两种场景下均能显著缓解模态贡献漂移,同时有效保持模型在旧任务上的性能,证明了该方法的广泛适用性和鲁棒性。