AI News HubLIVE
サイト内リライト2 分で読了

推論のための思考認識KVキャッシュ圧縮:適応的注意マッチングによる手法

推論言語モデルは長い思考連鎖(CoT)を生成する際、KVキャッシュが線形に増加し、デコード時のメモリボトルネックになる。既存の圧縮手法は推論過程をフラットなトークン列として一様に圧縮し、CoT内のステップごとの重要度の違いを無視していた。本研究が提案するTAMは、思考分割・適応的予算配分・重要トークン保護を通じて、同じメモリ使用量で一様圧縮より精度を向上させ、周期的圧縮によりピークメモリを約65%削減する。

ソースarXiv Computational Linguistics著者: Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

推論言語モデルは複雑な問題を解く際、長い思考連鎖(chain-of-thought, CoT)を生成する。この内部推論は答えの質を高める一方、生成が進むにつれてデコード時に保持するキー・バリューキャッシュ(KVキャッシュ)が線形に増加し、メモリの主要なボトルネックになる。キャッシュ圧縮の研究はこれまでにも行われてきたが、多くの既存手法は推論軌跡をフラットなトークン列とみなし、一律の圧縮を適用していた。しかし実際のCoTでは、ステップごとの重要度は大きく異なる。

この論文で提案されているのは、思考認識注意マッチング(TAM)と呼ばれる手法である。TAMはCoTの階層的構造を活用するため、三つの仕組みを持つ。第一に「思考分割」で、推論軌跡を意味のあるブロックに分解する。第二に「適応的予算配分」で、各ブロックの重要度とサイズに応じて圧縮予算を割り当てる。第三に「重要トークン保護」で、注意重みの高い推論の要となるトークンを圧縮から守る。理論面では、この予算配分が凸誤差モデルの下で最適であること、そして逐次圧縮を行っても累積誤差が有界に保たれることが証明されている。

実験では、Qwen3-4BをAIME 2024とMATH-500のベンチマークに用いている。その結果、TAMは同じメモリ使用量でも一様圧縮より高い精度を示した。さらに、周期的な圧縮を導入することで、ピークメモリを3.1~3.2GBに抑えることができ、これは約65%の削減に相当する。同時に、精度も競争力のある水準を維持している。

論文はYang Liu氏らによって執筆され、全16ページ・5図からなる。2026年6月1日にarXiv(ID: arXiv:2608.12331)へ投稿され、cs.CL(計算と言語)およびcs.AI(人工知能)に分類されている。HTML実験版やTeXソースも公開されており、DataCiteを通じてarXiv DOIも付与されている。長い推論を必要とするモデルのデプロイやメモリ最適化に取り組む研究者にとって、TAMは思考構造をキャッシュ圧縮に組み込む新しい方向性を示している。