言語モデルはなぜ人間よりも驚かないのか?解析多重性不一致仮説の検証
驚き理論(surprisal theory)は単語の処理困難度を文脈における予測可能性と結びつけるが、言語モデル(LM)の驚きはガーデンパス文などの構文曖昧性において人間の困難さを系統的に過小評価する。本研究では「解析多重性不一致仮説」を検証する。この仮説は、LMは人間よりも同時により多くの異なる文解釈を考慮できると示唆する。リカレントニューラルネットワーク文法(RNNG)とワード同期ビームサーチを用い、単語の驚きの計算に使用する同時解析数を系統的に変化させた。その結果、同時解析数を減らすと予測されるガーデンパス効果の大きさは増加するが、人間の効果の全規模を捉えるにはほど遠いことがわかった。これは、LMと人間が利用できる同時解析数の違いだけではLMベースの驚きと人間の文処理を調和できないことを示唆している。
2026年5月14日、William TimkeyらによってarXivに投稿された論文(番号2605.15440)は、言語モデル(LM)と人間の文処理における驚き(surprisal)の違いを詳細に調査しています。驚き理論では、単語の処理困難度はその文脈における予測可能性によって決まるとされ、人間の文処理とLMの次語予測を結びつける可能性が示唆されています。LMの驚きは自然テキストの読書時間をうまく予測できますが、構文的曖昧性を操作した統制実験、特にガーデンパス文では、人間が経験する困難さを系統的に過小評価することが知られています。
この不一致を説明するために、著者らは「解析多重性不一致仮説」(Parse Multiplicity Mismatch Hypothesis)を提案しました。この仮説は、LMが人間よりも同時に多くの異なる文解釈を考慮できるため、LMの驚きが低くなるというものです。もし人間が作業記憶の制約により少数の解釈しか保持できないとすれば、LMの広範な探索が困難の過小評価につながると考えられます。この仮説を検証するため、研究チームはリカレントニューラルネットワーク文法(RNNG)とワード同期ビームサーチを用い、ビーム幅を調整することで単語の驚きを計算する際の同時解析数を体系的に変化させました。
実験の結果、同時に維持する解析数を減らすと、LMが予測するガーデンパス効果の大きさは確かに増加しましたが、その増加量は人間のデータに見られる効果の大きさには遠く及びませんでした。解析数を極端に少なくしても、LMの驚きは依然として人間の困難さを過小評価していました。この発見は、LMと人間の同時解析数の違いだけでは驚きの差を説明できないことを強く示唆しています。論文はさらに、人間の構文解析における記憶制約や注意メカニズムなど、他の要因が影響している可能性を指摘し、今後の研究の方向性を示しています。
この研究は、計算言語学の分野に重要な示唆を与えるとともに、人間の認知とLMの振る舞いの理解を深めるものです。モデルアーキテクチャや探索戦略の調整だけではLMと人間の文理解のギャップを埋めるのに不十分であり、人間の認知特性をより反映したモデリング手法の開発が求められています。