MIITA:面向小语言模型持续学习的内存驱动推理时适配框架
MIITA是一种专为资源受限环境下小语言模型(SLM)设计的持续学习框架,通过存储紧凑的修正方向原型并在推理时基于语义和不确定性线索检索,实现无破坏性的知识复用,有效缓解灾难性遗忘。实验表明,在固定内存预算下,MIITA能持续提升最终性能并减少遗忘。
MIITA(Memory-Induced Inference-Time Adaptation)是一项由Dong Li等人提出的创新框架,旨在解决小语言模型(SLM)在资源受限环境下进行持续学习时面临的灾难性遗忘问题。持续学习对于SLM适应不断变化的应用场景至关重要,但直接更新其有限的参数往往导致之前学到的知识被覆盖。尽管基于记忆的方法通过将知识存储与参数更新解耦来缓解这一问题,但现有针对大语言模型(LLM)的方法通常需要大量存储空间和强大的上下文推理能力,这超出了SLM的能力范围。
MIITA通过一种全新的思路应对这一挑战。它设计了一种紧凑的修正方向原型,并为每个原型附加语义锚点,从而以极低的存储成本编码重要的监督经验。在推理阶段,MIITA利用语义相似性和不确定性线索从记忆库中检索最相关的原型。检索到的修正方向通过门控机制对模型的隐藏状态进行临时调整,从而在不修改骨干网络参数、不增加提示、也不进行测试时反向传播的情况下,实现过去知识的安全复用。
理论分析表明,MIITA的设计与一阶损失减少、不确定性引导的检索以及方向覆盖密切相关,这有助于系统性地保留旧任务的知识。实验涵盖了多种持续学习场景,包括任务增量学习、类别增量学习和领域增量学习。在多个自然语言处理基准测试中,MIITA表现出一致的性能提升。例如,在GLUE子任务上,相比于直接微调和传统的记忆重放方法,MIITA在保持旧任务准确率的同时,显著提高了新任务的适应速度。其核心优势在于无需改变模型架构,仅通过记忆原型和推理时适配即可实现知识迁移。此外,MIITA的内存占用远低于基于完整样本重放的方法,使其非常适合在存储受限的设备上运行。研究团队还开源了相关代码,以便社区进一步验证和应用。这项研究不仅为小模型的持续学习奠定了理论依据,也为实际部署提供了可行的技术路径。