AI News HubLIVE
サイト内リライト2 分で読了

LinAlg-Bench:LLMの数学的推論における構造的障害モードを明らかにするフォレンジックベンチマーク

LinAlg-Benchは、3x3、4x4、5x5行列の厳密な次元勾配にわたって、10の最先端大規模言語モデルの構造化線形代数計算を評価する診断ベンチマークです。9つのタスクタイプと660のSymPy検証済み問題にわたり、6,600のモデル出力を徹底的に評価します。二値精度を超えて、LinAlg-Benchは3段階の自動フォレンジックパイプラインを導入し、1,156の失敗を10の主要エラータグと細かいサブタイプに分類し、LLMの数学的失敗がランダムではなく、アルゴリズムタイプと行列次元によって構造的に制約されていることを明らかにします。中心的な発見は、4x4スケールでの鋭い行動閾値です:それ以下ではモデルは実行エラー(符号追跡失敗、算術ドリフト、パリティエラー)で失敗しますが、それ以上では計算放棄に移行し、ツールロールプレイ、制約一貫性のある捏造、構造化幻覚を通じて応答をでっち上げます。この捏造から放棄への移行は、ほぼすべてのモデル階層とアーキテクチャにわたって普遍的であり、知識ギャップではなくワーキングメモリの限界を示唆しています。さらに、解法戦略の硬直性が5x5行列式の精度のほぼ完全な予測因子であること、制約認識型捏造という新たな構造化幻覚障害モードを文書化し、すべてのデータ、モデル出力、エラーラベル、判定パイプラインを公開しています。

ソースarXiv AI著者: Shradha Agarwal, Deepak Rajbhar, Tariq J

LinAlg-Benchは、研究者チームによって開発された新しい診断ベンチマークで、大規模言語モデル(LLM)の構造化線形代数計算の能力を体系的に評価するものです。このベンチマークは、3x3、4x4、5x5行列の次元勾配に特に焦点を当て、行列乗算、行列式計算、逆行列求解など9つの異なるタスクタイプをカバーしています。合計660のSymPy検証済み問題が用意され、各問題はGPT-4、Claude、Geminiなどの10の最先端LLMによって解答され、6,600のモデル出力が生成されました。

単純な正誤評価に加えて、LinAlg-Benchは3段階の自動フォレンジックパイプラインを導入し、1,156の失敗事例を詳細に分析しました。このパイプラインは、失敗を符号追跡失敗、算術ドリフト、パリティエラー、ツールロールプレイ、制約一貫性のある捏造、構造化幻覚など、10の主要エラータグと細かいサブタイプに分類します。この分析により、LLMの数学的失敗はランダムではなく、アルゴリズムの種類と行列の次元によって構造的に制約されていることが明らかになりました。

研究の中心的な発見は、モデルが4x4スケールで鋭い行動閾値を示すことです。3x3行列の場合、モデルは通常計算を試みますが、符号エラー、算術精度のドリフト、パリティ処理の誤りなどの実行エラーで失敗します。しかし、4x4および5x5行列に直面すると、モデルの行動は根本的に変化します。実際の計算を試みる代わりに、ツールロールプレイ(電卓を使っているふり)、制約一貫性のある捏造(もっともらしい答えをでっち上げる)、構造化幻覚(問題の制約に一致するが完全に誤った数値を生成する)を通じて応答をでっち上げます。この捏造から放棄への移行は、ほぼすべてのモデル階層とアーキテクチャにわたって普遍的であり、単なる知識ギャップではなく、ワーキングメモリの固有の限界を示唆しています。

さらなる分析により、解法戦略の硬直性が5x5行列式の計算精度のほぼ完全な予測因子であることも判明しました。単一の解法に固執し、問題に応じて戦略を調整しないモデルは、一般的にパフォーマンスが低下します。さらに、研究では「制約認識型捏造」と呼ばれる新しい構造化幻覚障害モードが記録されました。これは、モデルが生成した誤った答えが、問題のすべての制約条件を数値的に満たしているにもかかわらず、正解ではないというものです。

すべてのデータ、モデル出力、エラーラベル、判定パイプラインは公開されており、他の研究者がこの研究を再現し拡張することができます。LinAlg-Benchは、LLMの数学的推論能力に深い診断的視点を提供するだけでなく、将来のモデルのワーキングメモリと戦略的柔軟性を改善するための方向性を示しています。