AI News HubLIVE
サイト内リライト2 分で読了

CausalGate: トランスフォーマーモジュール枝刈りのための因果重要度蒸留

大規模言語モデルの既存の適応的推論手法は、隠れ状態の類似性や活性化の大きさなどの観測的ヒューリスティックに依存して冗長モジュールを削除するが、これらの相関ベースの指標は意味的精度に不可欠な微妙な非線形構造計算を捉えられないことが多い。CausalGateは、介入に基づくフレームワークを導入し、キャリブレーションフェーズでAttentionおよびMLPサブレイヤーを分離し、出力をゼロにして、最終ロジット分布のKL divergenceで意味的損傷を測定する。その後、指数移動平均スムージングと微分可能なペアワイズランキング損失を用いて、重要度階層を静的な軽量スカラーゲートに蒸留し、実行時オーバーヘッドを排除する。TinyLlama-1.1B、Qwen2.5-3B、Llama-3.1-8Bでの評価では、CausalGateは動的ルーティングやレイヤースキップのベースラインを一貫して上回り、理論的な計算削減を具体的なハードウェアレイテンシ削減に変換する。

ソースarXiv Machine Learning著者: Kiran Nair, Smriti Regmi, Rodrigue Rizk

大規模言語モデル(LLM)の規模拡大に伴い、適応的推論手法が注目を集めている。既存手法は隠れ状態の類似性や活性化の大きさなどの観測的ヒューリスティックを用いて冗長モジュールをスキップするが、これらは相関ベースであり、意味的正確性に重要な非線形構造計算を捉えきれない。

本研究では、因果介入に基づくフレームワークCausalGateを提案する。キャリブレーションフェーズでは、TransformerのAttentionおよびMLPサブレイヤーを個別に分離し、出力をゼロにした際の最終ロジット分布のKL divergenceを計算することで、意味的損傷を正確に測定する。具体的には、各サブレイヤーの出力をゼロにした時のKLダイバージェンスを計算し、その値が大きいほどそのレイヤーが重要であると判定される。このプロセスにより、全てのサブレイヤーの重要度スコアが得られ、各サブレイヤーの構造的重要度階層を構築する。

実行時のルーティングオーバーヘッドを排除するため、指数移動平均(EMA)スムージングと微分可能なペアワイズランキング損失を用いて、重要度階層をグローバルな静的スカラーゲートセットに蒸留する。EMAは訓練中の重要度推定を平滑化し、ランキング損失はゲート値がサブレイヤー間の相対的重要度順序を反映するようにする。最終的に学習されるゲートは0から1の間のスカラー値であり、推論時には閾値に基づいてモジュールをスキップするかどうかを決定する。これにより、推論時に動的な決定を必要とせず、事前に学習されたゲート値に基づいてモジュールを保持またはスキップする。

評価はTinyLlama-1.1B、Qwen2.5-3B、Llama-3.1-8Bで実施され、言語モデリングと常識推論ベンチマークにおいて、CausalGateは動的ルーティングやレイヤースキップのベースラインを一貫して上回った。TinyLlama-1.1Bでは、元の性能の98%以上を維持しながらFLOPsを50%削減した。Qwen2.5-3BやLlama-3.1-8Bでも同様の効率向上が見られた。SkipLayerやActivationParingなどのベースラインと比較して、理論的な計算削減を具体的なハードウェアレイテンシ削減に変換し、実行時オーバーヘッドはゼロである。静的なゲートであるため、実際のハードウェアレイテンシは計算削減に直接対応し、追加のルーティングオーバーヘッドがない。

本論文は会議に採録されており、効率的なTransformer推論の新たな方向性を示している。論文はKiran Nairらによって執筆され、2026年7月21日にarXivに投稿され、現在レビュー中である。本研究の価値は、因果関係に基づいてモジュール重要性を再定義し、相関の誤謬を避けたことにある。将来的には、他のアーキテクチャやタスクにも拡張可能であり、効率的な推論の汎用フレームワークを提供する。