ART:効率的な大規模言語モデル復号化のためのアテンション実行時終了
大規模言語モデル(LLM)における長文脈復号化は、大規模なキー・バリュー(KV)キャッシュを取得するためのメモリ帯域幅により制約される。既存のKV管理手法は復号化前にキーのみを刈り込むが、アテンション出力はキーとバリューに共同で依存する。本論文では、ART(Attention Run-time Termination)を提案する。これはカーネル実行中に累積アテンション出力を追跡し、寄与が無視できるようになるとKVブロックアクセスを終了する軽量な実行時機構である。ARTは既存のキーベース手法と直交し、シームレスに統合できる。LongBenchベンチマークでは、ARTは大バッチサイズにおいて最先端のベースラインと比較して20%高い生成スループットを達成し、精度も同等である。
大規模言語モデル(LLM)の長文脈復号化における主要な課題は、メモリ帯域幅の制約です。コンテキスト長が増加するにつれて、モデルは巨大なキー・バリュー(KV)キャッシュに頻繁にアクセスする必要があり、これが生成速度を大幅に制限しています。既存のKVキャッシュ管理手法のほとんどは、復号化前にキーのみを刈り込む方式を採用していますが、アテンション出力はキーとバリューの両方に依存するため、このアプローチは不十分です。刈り込み時にバリューを考慮しようとすると、計算オーバーヘッドが法外に大きくなります。
この問題に対処するため、Chen Qiu、Guozhong Li、Panos Kalnis は Attention Run-time Termination(ART)を提案しました。ARTは軽量な実行時機構であり、カーネル実行中に累積アテンション出力を監視します。後続のKVブロックの寄与が無視できるほど小さくなると、ARTはそれらのブロックへのアクセスを早期に終了し、メモリ帯域幅を節約します。この設計により、ARTは既存のキーベースの刈り込み手法と直交し、モデルアーキテクチャを変更することなく既存システムにシームレスに統合できます。
研究チームはLongBenchベンチマークで実験を行い、ARTの性能を評価しました。結果として、大バッチ処理シナリオにおいて、ARTは最先端のベースライン手法と比較して20%高い生成スループットを達成し、同時に同等の精度を維持しました。これはARTがモデルの品質を犠牲にすることなく復号化プロセスを大幅に高速化できることを示しています。
ARTの提案は、LLMの効率的な長文脈処理に新たな視点を提供します。その軽量性と統合容易性により、ARTは将来のLLM推論システムの重要なコンポーネントになると期待されます。本論文はarXiv(番号:2606.00024)に提出され、再現のためのコードとデータへのリンクも提供されています。