AI News HubLIVE
站内改写1 分钟阅读

通过 Meta-LoRA 学习跨域偏好适配,实现大语言模型个性化

这篇论文提出了一种用于大语言模型跨域零样本/少样本个性化推荐的 PAC-Bayes 正则化 Meta-LoRA 方法。它通过元学习的 LoRA 初始化作为起点和先验中心,根据支持集大小和预测不确定性调整更新强度,从而避免稀疏证据下的过拟合,并将用户偏好与领域偏好功能分解。在多个基准上超过强基线,在 HiCUPID 上跨域胜率下降减少 47.9%,冷启动胜率提升 110.2%。

来源arXiv AI作者: Xuefei Wang, Jun Han, Zixuan Wang, Qingkai Zeng, Xiao Wang, Ruijie Wang, Jianxin Li

跨领域零样本或少样本个性化是大型语言模型应用中的一个重要挑战。其目标是仅凭目标对话领域中的少量交互记录,就能在未见过的对话场景中生成符合用户偏好的回复。然而,现有方法在这一设定下面临两难:基于适配的方法在证据稀疏时难以校准更新幅度,容易过拟合;基于历史迁移的方法又容易将用户偏好与源领域特有痕迹纠缠在一起,导致不可靠的个性化先验和负迁移。

针对这一问题,本文提出了一种名为 PAC-Bayes 正则化 Meta-LoRA 的方法。该方法利用元学习得到的 LoRA 初始化既作为适配的起点,也作为先验中心,同时根据支持集大小和预测不确定性动态调整更新强度。这样既能在证据稀少或语义模糊时限制过拟合,又能随着证据增多逐步增强个性化效果。

但研究人员指出,仅仅控制适配强度并不能决定哪些偏好应该跨域迁移,以及这些偏好应该如何表达。因此,他们进一步将个性化先验进行功能分解:把稳定的用户偏好用人类可读的提示词来表示,把领域特有的隐空间调节用保持拓扑结构的软令牌来实现。这种设计避免了源领域痕迹污染,并提升了可解释性和迁移性。

在多个基准和个性化任务上的实验显示,该方法一致地强于现有强基线。在 HiCUPID 数据集上,与最佳竞争基线相比,跨域胜率下降幅度减少了 47.9%;在未见过用户的冷启动场景下,胜率提高了 110.2%。

论文由 Xuefei Wang 等七位作者撰写,于 2026 年 8 月 1 日提交至 arXiv,编号为 2608.12389,所属学科为人工智能(cs.AI),并获得了 DataCite 分配的 DOI。这一工作为低资源个性化场景下的大模型适配提供了一种新的思路,也为后续在训练与推理阶段进一步解耦用户与领域信号的研究打下了基础。