AI News HubLIVE
站内改写1 分钟阅读

基于超网络的大语言模型知识注入的缩放定律

研究者探索了使用超网络在训练时将大规模事实知识注入大语言模型,并首次系统研究了超网络架构的缩放行为。实验表明,超网络注入在损失、推理准确率及OOD泛化上遵循幂律缩放,且随着规模增大,OOD泛化表现可靠,优于LoRA微调和全微调。他们创建了包含数千万多跳问答样本的MegaWikiQA数据集。

来源arXiv Computational Linguistics作者: Nischay Dhankhar, Dos Baha, Abulhair Saparov

在大语言模型(LLM)中可靠且大规模地注入事实知识仍是一个开放挑战。超网络提供了一种有前景的解决方案,但之前主要应用于测试时适应。在一篇新的预印本论文中,研究人员探索了超网络在训练时知识注入中的应用,并首次系统研究了其缩放规律。

该方法基于一个超网络,给定大量事实语料,训练该超网络生成固定的LoRA适配器,插入目标模型后使模型能够回答关于这些事实的问题。这种设计将超网络的注入能力与目标模型的通用能力解耦,从而能够独立研究超网络架构的缩放行为。

为了进行实验,团队构建了名为MegaWikiQA的大规模数据集,包含来自Wikidata5M的3900万个多跳问答样本,覆盖39个领域。他们分析了损失、推理准确率和OOD泛化如何随超网络深度、宽度和目标网络大小变化。

结果显示:(i) 基于超网络的知识注入在所有架构轴上表现出广泛的预测性幂律缩放;(ii) 超网络在增大的规模下能够可靠地进行OOD泛化。值得注意的是,超网络在OOD评估中的缩放指数比LoRA微调和全微调更陡峭,表明它作为一种训练时适应方法具有更强的泛化能力。

这些贡献首次提供了经验上基于缩放定律的指导,确立了超网络作为大语言模型事实推理中一种有原则且可扩展的训练时适应方案。论文还提供了开源数据集和代码,以促进未来研究。这项工作的发现对于构建能够动态吸收新知识的大型语言模型具有重要意义,有望推动知识密集型应用的发展。