AI News HubLIVE
サイト内リライト2 分で読了

「slightly」と「somewhat」は同じ意味か?LLMの数値行動における曖昧な強度語の測定

制御実験により、Claude Haikuはリソース割り当てタスクにおいて10個の英語強度修飾語を5つの異なる中央値出力に圧縮し、強度語の解釈がシステム状態に強く依存し、動作限界付近では3つの行動モードを示すことが明らかになった。

ソースarXiv Computational Linguistics著者: Daniel Tabach (Georgia Institute of Technology)

arXivで公開された新しい研究(論文番号:2605.21827)は、言語モデル(LLM)が数値行動を生み出す自然言語命令を受け取った際に、「slightly」や「drastically」といった曖昧な強度語をどのように解釈するかを体系的に調査した。ジョージア工科大学のDaniel Tabach氏が実施したこの研究は、LLMがこれらの強度語の順序的な意味を保持しているかどうかを検証することを目的としている。

研究者は、Quirkらの程度修飾語分類法に基づき、「slightly」から「drastically」までの10個の英語程度修飾語からなる尺度を構築した。制御されたリソース割り当て環境において、Claude Haikuモデルは自然言語命令を受け取り、数値割り当てを生成し、決定論的なバックエンドがその割り当てを測定可能な結果に変換する。実験では、変更される変数は強度語または開始システム状態のみであり、それらがモデルの数値出力に与える影響を分離している。

温度パラメータ0.0および0.7で合計6,620回の実行を行った結果、3つのパターンが明らかになった。第一に、モデルは10個の強度語を5つの異なる中央値出力に圧縮する。下位4つの語(例:「slightly」「a bit」)はすべて同じ値にマッピングされる一方、強い語はより高い領域に分類された(スピアマンのρ=0.845、p<0.001)。これは、モデルが弱い強度語をほとんど区別できないことを示している。

第二に、現在のシステム状態がコンテキストとして提供された場合、Kruskal-Wallis検定により、開始割り当てによるグループ化が単語によるグループ化よりもはるかに多くの順位分散を説明することが示された(開始割り当てに基づくε²=0.782、単語に基づくε²=0.079)。システムが容量に近づくにつれて、語彙的な区別はゼロにまで低下し、コンテキスト状態が数値決定を支配することが明らかになった。

第三に、実現可能性の限界に近づくと、モデルは3つの行動モードを示す:弱い語は小さな調整で回避し、強い語は完全に棄権し、「drastically」という語は割り当てを局所的な上限まで押し上げる。これらのパターンは温度変化にかかわらず一貫しており、確率的サンプリングは分布を広げるものの、語間の順序区別を回復しなかった。

この研究は、このモデルとドメインにおいて、言語モデルによる曖昧な強度語の数値解釈が圧縮され、状態に依存し、動作境界付近で不連続であることを明らかにした。これらの知見は、程度修飾語を含む自然語言語命令の下でLLMが数値タスクを実行する方法を理解する上で重要である。