良い文章とは何か?LLMの推論軌跡から文学的な質の暗黙理論を抽出しテストする
本研究は、推論可能な大規模言語モデル(LLM)が文学的な質をどのように評価するかを2つの実験で調査した。実験1では、6つの品質段階にわたる30の実テキストからなるベンチマークを構築し、モデルの暗黙的な質の理論を抽出。その理論は、正確さよりも意図性、技巧、深み、独自の声を重視するものだった。実験2では、5つの古典的散文に対する系統的な劣化処理により、語彙の単純化は質の低下が最も小さい一方、構造や声の喪失ははるかに大きいことが判明した。これらの結果は、LLMによる文章品質の判断が全体的で著者固有であり、語彙的特徴よりも構造的特徴に敏感であることを示唆し、自動作文フィードバックや計算美学に示唆を与える。
良い文章とは何か?この問いは文学研究と計算言語学において長年にわたる中心的な問題である。最近arXivに投稿された論文「What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces」は、推論可能な大規模言語モデル(LLM)が文学的な質をどのように評価するかを2つの体系的な研究で探求し、その背後にある暗黙の理論を明らかにしている。
最初の研究では、古典文学から匿名フォーラムの投稿まで6つの品質段階にわたる30の実テキストからなるベンチマークを構築した。研究者らはDeepSeekモデルを使用し、その推論軌跡を分析することで、モデルが文学的な質を評価する際の暗黙の基準を抽出した。5回の再現実験の結果、モデルは平均79.3%の段階分類精度を達成し、一貫した評価傾向を示した。推論軌跡から明らかになったのは、モデルが正確さよりも意図性を重視し、技巧、深み、独自の声を優先するという理論である。さらに、スタイルが一致するが認識できないパッセージを用いた親近性実験により、ソース認識がスコアを膨らませる可能性が示唆された。ただし、この結果は古典的原作と研究者が作成した模作との間の真の質の違いと交絡しているため、解釈には注意が必要である。
第二の研究では、この理論をさらに検証するため、5つの古典的散文パッセージに対して系統的な劣化処理を施した。具体的には、語彙の単純化、リズムの平坦化、イメージの除去、声の一般化、構造の単純化、および複合劣化の6つの操作を適用し、各バージョンを再評価した。結果として、語彙の単純化による質の低下は最小(0.41 ± 0.46点)であり、構造の単純化(2.78点)や声の一般化(2.34点)による低下をはるかに下回った。複合劣化は最も大きな影響を与え(-5.64点)、質を大幅に低下させたが、その効果は劣加法性を示した。Qwen QwQモデルとの探索的比较でも同様の全体的な質的パターンが確認された。
これらの研究を総合すると、LLMによる文章品質の判断は全体的で著者固有であり、語彙的特徴よりも構造的特徴に対してより敏感であることが示唆される。この発見は、自動作文フィードバックシステムや計算美学の分野に重要な示唆を与える。特に、モデルが何を重視して評価を行っているかを理解することで、より効果的なフィードバックの設計やコンテンツ生成ツールの開発に役立つと考えられる。