AI News HubLIVE
サイト内リライト2 分で読了

大規模言語モデルにおけるハイパーネットワークベースの知識注入のスケーリング法則

研究者らは、ハイパーネットワークを用いた学習時知識注入を大規模言語モデルに適用し、ハイパーネットワークアーキテクチャのスケーリング挙動を初めて体系的に調査した。実験では、損失、推論精度、OOD汎化において冪乗則スケーリングが確認され、規模拡大に伴いOOD汎化が信頼性を増し、LoRAや完全ファインチューニングを上回る性能を示した。また、数千万のマルチホップQAサンプルを含むMegaWikiQAデータセットを構築した。

ソースarXiv Computational Linguistics著者: Nischay Dhankhar, Dos Baha, Abulhair Saparov

大規模言語モデル(LLM)に事実知識を信頼性高く大規模に注入することは、依然として未解決の課題である。ハイパーネットワークは有望な解決策を提供するが、これまでは主にテスト時適応に適用されてきた。新しいプレプリント論文で、研究者らはハイパーネットワークの訓練時知識注入への利用を探り、初めてそのスケーリング挙動を体系的に研究した。

提案手法では、大量の事実コーパスを元に、ハイパーネットワークを訓練して固定のLoRAアダプタを生成する。このアダプタを対象モデルに挿入することで、モデルはそれらの事実に関する質問に答えられるようになる。この設計により、ハイパーネットワークの注入容量と対象モデルの汎用能力が分離され、ハイパーネットワークアーキテクチャのスケーリング法則を厳密に研究することが可能となった。

実験のために、チームはMegaWikiQAという大規模データセットを構築した。これはWikidata5Mから得られた3900万のマルチホップ質問応答サンプルを含み、39ドメインをカバーする。彼らは損失、推論精度、および分布外(OOD)汎化が、ハイパーネットワークの深さ、幅、対象ネットワークサイズとともにどのように変化するかを分析した。

結果は以下の通りである:(i) ハイパーネットワークベースの注入は、すべてのアーキテクチャ軸に沿って広範囲に予測可能な冪乗則スケーリングを示す;(ii) ハイパーネットワークは規模の増大に伴い、信頼性の高いOOD汎化が可能である。注目すべき点として、ハイパーネットワークはOOD評価において、LoRA微調整や完全ファインチューニングよりも急峻なスケーリング指数を示し、訓練時適応手法として優れた汎化能力を持つことが示唆された。

これらの成果は、初めて経験的に根拠づけられたスケーリング法則を提供し、ハイパーネットワークを大規模言語モデルにおける事実推論のための原則的かつスケーラブルな訓練時適応基盤として確立する。データセットとコードは公開されており、今後の研究を促進することが期待される。