AI News HubLIVE
站內改寫1 分鐘閱讀

基於超網絡的大語言模型知識注入的縮放定律

研究者探索了使用超網絡在訓練時將大規模事實知識注入大語言模型,並首次系統研究了超網絡架構的縮放行為。實驗表明,超網絡注入在損失、推理準確率及OOD泛化上遵循冪律縮放,且隨着規模增大,OOD泛化表現可靠,優於LoRA微調和全微調。他們創建了包含數千萬多跳問答樣本的MegaWikiQA數據集。

來源arXiv Computational Linguistics作者: Nischay Dhankhar, Dos Baha, Abulhair Saparov

在大語言模型(LLM)中可靠且大規模地注入事實知識仍是一個開放挑戰。超網絡提供了一種有前景的解決方案,但之前主要應用於測試時適應。在一篇新的預印本論文中,研究人員探索了超網絡在訓練時知識注入中的應用,並首次系統研究了其縮放規律。

該方法基於一個超網絡,給定大量事實語料,訓練該超網絡生成固定的LoRA適配器,插入目標模型後使模型能夠回答關於這些事實的問題。這種設計將超網絡的注入能力與目標模型的通用能力解耦,從而能夠獨立研究超網絡架構的縮放行為。

為了進行實驗,團隊構建了名為MegaWikiQA的大規模數據集,包含來自Wikidata5M的3900萬個多跳問答樣本,覆蓋39個領域。他們分析了損失、推理準確率和OOD泛化如何隨超網絡深度、寬度和目標網絡大小變化。

結果顯示:(i) 基於超網絡的知識注入在所有架構軸上表現出廣泛的預測性冪律縮放;(ii) 超網絡在增大的規模下能夠可靠地進行OOD泛化。值得注意的是,超網絡在OOD評估中的縮放指數比LoRA微調和全微調更陡峭,表明它作為一種訓練時適應方法具有更強的泛化能力。

這些貢獻首次提供了經驗上基於縮放定律的指導,確立了超網絡作為大語言模型事實推理中一種有原則且可擴展的訓練時適應方案。論文還提供了開源數據集和代碼,以促進未來研究。這項工作的發現對於構建能夠動態吸收新知識的大型語言模型具有重要意義,有望推動知識密集型應用的發展。