長さ価値モデル:トークンレベルの長さモデリングのためのスケーラブルな価値事前学習
Appleの研究者らは、各デコードステップで残りの生成長を予測するトークンレベルフレームワーク「長さ価値モデル(LenVM)」を提案する。長さモデリングを価値推定問題として定式化し、生成トークンごとに一定の負の報酬を割り当てることで、アノテーション不要で密、不偏、かつスケーラブルな教師信号を提供する。LLMおよびVLMでの実験では、LIFEBenchの正確な長さマッチングタスクにおいて、LenVMを適用した7Bモデルの長さスコアが30.9から64.8に向上し、最先端のクローズドソースモデルを凌駕した。さらに、性能と効率のトレードオフの連続的な制御や、プロンプトからの総生成長の予測も可能にする。
Appleの機械学習研究チームは、長さ価値モデル(Length Value Model, LenVM)を発表した。これは、自己回帰モデルのデコード過程において、残りの生成長をトークンレベルでモデル化する革新的なフレームワークである。この研究は、トークンが現代の自己回帰モデルにおける基本的な計算単位であり、生成長が推論コストと推論性能に直接影響するという認識に基づいている。既存の手法は主に粗いシーケンスレベルの長さモデリングに留まっていた。
LenVMは長さモデリングを価値推定問題として捉え、各生成トークンに一定の負の報酬を割り当てる。モデルは割引されたリターンを予測し、それが残り生成長の単調な指標となる。この教師信号は、アノテーション不要、密、不偏、かつスケーラブルである。大規模言語モデル(LLM)および視覚言語モデル(VLM)を用いた実験では、LIFEBenchの正確な長さマッチングタスクにおいて、LenVMを適用した7Bモデルの長さスコアが30.9から64.8に劇的に改善され、最先端のクローズドソースモデルを上回った。
さらに、LenVMは性能と効率のトレードオフを連続的に制御することを可能にする。GSM8Kタスクでは、トークン予算が200の場合、LenVMは63%の精度を維持したのに対し、ベースラインはわずか6%であった。また、プロンプトの境界から総生成長を正確に予測できる。トークンレベルの価値は生成ダイナミクスの解釈可能なビューを提供し、特定のトークンが推論をより短いまたは長い方向にシフトさせる様子を示す。
このページでは、関連研究として「Transformerにおける長さ汎化の形式的フレームワーク」(ICLR 2025)と「データセット分解:可変シーケンス長カリキュラムによる高速LLM訓練」(NeurIPS 2024)も紹介されている。前者は因果的Transformerの長シーケンスへの汎化を理論的に分析し、後者は可変長シーケンスを用いた訓練の高速化を提案している。これらの研究は、言語モデルにおける長さ制御と理解の向上に貢献する。