AI News HubLIVE
站内改写1 分钟阅读

DualOptim+:桥接共享与分离优化器状态,提升大语言模型的机器遗忘能力

DualOptim+是一个新型优化框架,通过引入基态和增量态,自适应地桥接共享与分离的优化器状态,以改善大语言模型中的机器遗忘。实验表明,该框架在遗忘、安全对齐和多任务学习等任务中取得了更优的权衡。

来源arXiv Machine Learning作者: Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

香港城市大学的研究团队近日提出了名为DualOptim+的新型优化框架,旨在显著提升大语言模型(LLM)的机器遗忘(machine unlearning)性能。该研究成果已被机器学习顶级会议ICML 2026接收。

机器遗忘技术旨在让模型在特定数据集上“忘记”所学信息,同时保持对其他知识的记忆,这在隐私保护、模型修正和去除不良内容等方面具有重要应用。然而,遗忘目标与保留目标之间往往存在冲突,导致现有方法难以取得良好平衡。

DualOptim+通过引入基态(base state)和增量态(delta states)来巧妙化解这一冲突。基态捕捉遗忘和保留目标的共同表示,而增量态则分别保留各自特定的残差信息。优化器能够根据遗忘梯度与保留梯度之间的方向冲突程度,自适应地桥接这两种状态,从而在优化过程中动态平衡不同目标。

此外,研究团队还推出了DualOptim+的量化变体——DualOptim+ 8bit,通过8位量化技术大幅减少内存占用,同时不牺牲模型性能。实验涵盖了虚构和真实世界的遗忘任务、安全对齐以及多任务学习等多种场景。结果表明,DualOptim+在多目标优化中始终能够实现更优的权衡,显著优于现有方法。

该工作的代码已在GitHub上开源,为大型语言模型的机器遗忘领域提供了新的优化思路和实用工具。