大規模言語モデルのための畳み込み
この研究では、軽量な深さ方向畳み込みがモデルサイズを大幅に増やすことなく、LLMに局所的な帰納バイアスを提供できるかどうかを調査しています。Qwen3 Transformerブロックの17箇所でのマクロレベルのアブレーションにより、最適な配置は注意機構の前に投影されたクエリ、キー、バリューに畳み込みを適用することであることがわかりました。ミクロレベルの研究では、追加の正規化や活性化なしでカーネルサイズk=3の残差深さ方向畳み込みが好まれました。複数のQwen3モデルと事前学習データ予算において、この設計は7つの下流ベンチマークの平均精度を向上させ、パラメータ増加は0.01%未満でした。表現レベルのケーススタディでは、畳み込みにより繰り返しトークンIDが直接的な文脈に敏感になることが示唆されています。これらの結果は、短距離トークン相互作用をモデル化するための自己注意の軽量な補完として深さ方向畳み込みを支持しています。
大規模言語モデル(LLM)は主にTransformerに依存しており、自己注意機構はグローバルなトークン間の相互作用を提供する一方で、自然言語が持つ局所性を明示的に符号化していません。Yuchuan Tianら10名の研究者による新しい研究(arXiv:2607.18413、2026年7月20日投稿)では、軽量な深さ方向畳み込みがモデルサイズを実質的に増加させることなく、この局所的帰納バイアスを供給できるかどうかを体系的に調査しました。
研究チームはQwen3 Transformerブロックを対象に、マクロレベルのアブレーション実験を実施しました。ブロック内の17箇所に畳み込みを挿入し、下流タスクへの影響を比較した結果、注意機構の前に投影されたクエリ、キー、バリュー(QKV)に畳み込みを適用する配置が最適であることが判明しました。続くミクロレベルの設計探索では、カーネルサイズ3の残差深さ方向畳み込みが最良とされ、追加の正規化層や活性化関数は不要と結論づけられました。
提案手法の汎用性を検証するため、異なる規模のQwen3モデルと複数の事前学習データ予算を用いて評価が行われました。7つの下流ベンチマーク(常識推論、テキスト分類などを含む)において、平均精度が向上し、追加されるパラメータは総パラメータの0.01%未満に抑えられました。さらに、表現レベルのケーススタディでは、畳み込みにより繰り返し出現するトークンIDがその直接的な文脈に対してより敏感になることが示され、局所情報のモデリング能力が向上したことが示唆されました。
この研究は、深さ方向畳み込みが自己注意の軽量な補完として短距離トークン相互作用のモデリングに有効であることを示しており、LLMの構造改善へのシンプルかつ効果的なアプローチを提供しています。
(注:本記事はarXiv論文の内容に基づいて執筆されており、原著论文の詳細はhttps://arxiv.org/abs/2607.18413を参照ください。)