本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

OlmPool:小さなアーキテクチャ選択が積み重なり長コンテキスト拡張を損なう仕組み

記事の要約

OlmPoolは26のモデルからなる制御されたスイートで、トレーニングデータと拡張レシピを一定に保っても、小さなアーキテクチャ選択が積み重なり長コンテキスト拡張をはるかに困難にすることを示しています。

ソースAi2 Blog
OlmPool:小さなアーキテクチャ選択が積み重なり長コンテキスト拡張を損なう仕組み
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

ほとんどの言語モデルは短いテキストシーケンスでトレーニングされ、その後、より長いドキュメントでの追加トレーニング(コンテキスト拡張)によって長い入力を処理できるようになります。Llama 3の事前学習データはプロプライエタリであるため、その拡張の容易さがアーキテクチャによるものか、トレーニングデータによるものかを判断するのは困難でした。研究者は同じ拡張手法が他のアーキテクチャに転送可能であると想定してきましたが、OlmPoolの研究はそれがしばしば当てはまらないことを示しています。

OlmPoolは、Allen Institute for AI(Ai2)によって開発された制御されたモデルスイートで、26の7Bモデルから構成されます。すべてのモデルは同じデータで1400億トークンの事前学習を行い、同じ長コンテキストデータ混合と手順を使用して64Kコンテキストに拡張されました。唯一変化するのはアーキテクチャです。研究は、アテンションメカニズムに影響を与える4つのアーキテクチャ選択に焦点を当てています:QK正規化、グループ化クエリアテンション(GQA)、スライディングウィンドウアテンション、および事前学習コンテキスト長。

研究によると、これらの選択は単独では穏やかな影響しかありません:QK正規化が最も大きな影響を持ち、それを削除し正規化順序を変更するとHELMETベンチマークで6ポイントの改善が見られます。GQAと短い事前学習コンテキスト長はそれぞれ小さな低下を引き起こし、スライディングウィンドウアテンションは単独で約1ポイントの低下をもたらします。しかし、これらが組み合わさると、効果は各部分の和をはるかに超えます。例えば、すでにGQAを持つモデルにスライディングウィンドウアテンションを追加すると、平均で9ポイントの低下を引き起こします。最悪の構成は、アテンションの柔軟性を制限する2つ以上の選択を組み合わせたものです。

さらに重要なことに、標準的なトレーニング信号は長コンテキスト性能をほとんど予測できません。トレーニング損失、検証パープレキシティ、および16の短コンテキストベンチマークでは、どのモデルが32Kまたは64Kコンテキストで良いパフォーマンスを発揮するかを識別できません。同じベンチマークの8K分割でのスコアでさえ、拡張後の二桁の変動を予測できません。拡張後にほぼ同一に見えるモデルでも、HELMETで26ポイント以上乖離することがあります。

また、Llama 3のアーキテクチャ構成は強力ですが、すべての場合で最適とは限らないことがわかりました。他のいくつかのモデルがそれを明確に上回っています。これは、Llama 3の長コンテキスト成功が主にアーキテクチャによるものであり、Llamaで検証された拡張手法は他のモデルファミリーに適応させる必要があることを示唆しています。アーキテクチャ起因のギャップはデータを増やしても解消されません。最悪のアーキテクチャは、500億トークンのコンテキスト拡張(トレーニング全体の26%)後でも、Llamaアーキテクチャが10億トークンで達成するパフォーマンスに達しません。

アテンションパターンの分析により、QK正規化がないモデルはより強いアテンションシンクを発達させることが明らかになりました。これは、入力の初期位置(通常最初の数トークン)が、現在の予測に無関係でも一貫して大きなアテンションを受け取る現象です。より強いシンクは長コンテキスト性能の向上と相関しており、QK正規化がないモデルが長距離検索をサポートするためのデフォルト戦略であることを示しています。針の中の針テストでは、QK正規化があるモデルはターゲット情報に割り当てるアテンションが少なく、全体的な長コンテキスト性能の低さと一致しています。

OlmPoolスイートは完全に公開されており、事前学習とコンテキスト拡張の各段階における26モデルすべての38チェックポイントが含まれています。この研究は、アーキテクチャ選択の組み合わせが、実務者が期待するよりもはるかに低い長コンテキスト性能を生み出す可能性があり、この結果は標準的なトレーニング信号からは見えないことを強調しています。研究者は、このリソースがより良いコンテキスト拡張手法の開発や、初期事前学習における他の現象の研究に役立つことを期待しています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 4つのアーキテクチャ選択(QK正規化、グループ化クエリアテンション、スライディングウィンドウアテンション、事前学習コンテキスト長)はそれぞれ単独では影響が小さいが、組み合わさると長コンテキスト性能が最大47%低下する。
  • 標準的なトレーニング指標では長コンテキスト性能を予測できず、標準評価でほぼ同一に見えるモデルが拡張後に26ポイント以上乖離することがある。
  • Llama 3の長コンテキスト成功は主にアーキテクチャによるものだが、常に最適とは限らず、他の構成が勝る場合もある。
  • アーキテクチャ起因のギャップはデータを増やしても解消されず、アテンションパターン(シンク)が違いを説明する。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。