中国のネット上のコメントには、皮肉、冗談、ほのめかしなど、文脈がなければ解釈が難しい“社会的な意味”がしばしば込められています。“本当に分からなかった?”——この一言だけでは、本気の質問なのか、皮肉なのか、それとも冗談なのか見分けがつきません。
Shiwei Hong氏ら8名の著者による論文は、こうした状況埋め込み型の語用論的意味を大規模言語モデル(LLM)が復元できるかを評価する新しいベンチマークを提案しています。研究チームは20万件以上の公開中国ソーシャルメディア上のやり取りをもとに、4,735件の人間検証済み診断項目を作成しました。各項目は、対象のコメントと、再構築された直前の文脈、さらに「もっともらしい誤読」の選択肢で構成され、モデルがあるコメントが特定のやり取りの中で実際に何をしているのかを判別できるか試します。
実験では、8種類のLLMを問題作成者と解答者の両方の役割で評価する、leave-writer-out(書き手を交えない)設定が採用されました。結果はこのタスクの難しさを示し、最強モデルの精度は81.42%、8モデルの平均は68.70%にとどまりました。一方、人間の精度は90.8%に達しています。
さらに事例分析により、モデルが広い意味での皮肉や遊び心を認識できる一方で、その“仕掛け”——例えば、どのような言葉の操作で皮肉が表現されているのか、どのような対人関係上の行動(非難なのか、親しみからのかけひきなのか)なのか——を正確に特定できないことが多いと分かりました。
この研究は、単に「不誠実な発言」や「面白い発言」を識別するだけでは不十分で、中国のオンラインコメントに見られる言語的・社会的に繊細な意味合いを理解するには、特定の会話の中で暗黙にやり取りされる“動作”まで捉える必要があることを示しています。論文タイトルの問いかけは、現状のモデルに対する著者らの答えを暗示しているかのようです。その多くは、やはり「本当に分かっていない」のだと。