AI News HubLIVE
站内改写1 分钟阅读

多语言知识编辑的大语言模型合并方法:一项实证探索

该论文系统评估了六种向量合并方法在多语言知识编辑(MKE)中的效果,发现带共享协方差的向量求和是最可靠的策略,而简单求和表现不佳。TSVM可在某些设置下改进性能,但缓解多语言干扰的能力有限。性能对权重缩放因子和秩压缩比敏感,较大的缩放因子和较低的秩通常带来更好结果。

来源arXiv Computational Linguistics作者: Kunil Lee, Ki-Young Shin, Jong-Hyeok Lee, Young-Joo Suh

近日,一篇题为《多语言知识编辑的大语言模型合并方法:一项实证探索》的论文在arXiv上发布,系统研究了向量合并方法在多语言知识编辑(MKE)中的应用。论文指出,尽管定位-编辑方法在单语言环境下效果良好,但多语言场景中不同语言的知识编辑会产生相互干扰,使得MKE任务尤为困难。

研究团队聚焦于三个核心问题:向量合并方法在MKE中的有效性、任务奇异向量合并(TSVM)减少多语言干扰的能力,以及权重缩放因子和秩压缩比对性能的影响。他们基于MzsRE基准,在批量编辑场景下评估了六种合并变体,涵盖了两种流行的骨干大语言模型、两种基础知识编辑方法以及12种语言。

实验结果显示,带共享协方差的向量求和是整体上最可靠的策略,而简单的求和(不共享协方差)表现不佳。TSVM能在部分设置中提升性能,但其缓解多语言干扰的能力有限。此外,性能对权重缩放因子和秩压缩比高度敏感,较大的缩放因子和相对较低的秩往往带来更好结果。

这些发现澄清了当前向量合并方法在MKE中的实际优势与局限,为未来多语言知识编辑研究提供了指导。论文作者包括Kunil Lee等三位研究人员,论文编号为arXiv:2605.13919,于2026年5月13日提交。该研究为多语言大模型的知识编辑提供了重要的实证基础,有助于推动相关领域的发展。