LLMはデータ可視化の微妙な視覚的アーティファクトを見逃すことが多い
最新の評価によると、最先端のLLMはデータプロットにおける微妙な視覚的アーティファクト(例えば、補完値による点の一直線上の配置)を見逃すことが多い。これは完全自律型データ分析エージェントの展開には慎重さが必要であることを示している。
患者データを受け取り、初めてRやPythonに読み込んだと想像してください。データの概要を把握するためにいくつかのプロットを作成すると、次のようなグラフに出くわします。「うーん、ほとんど正常に見えるが、いくつかの点が『適合』線と思われるものに完全に整列している。」さらに詳しく調べると、ある研究サイトの行のコレステロール値が補完されていることに気づきます。それらをNAに設定して作業を続けます。
現在の最先端のLLMはこのような異常を検出できるでしょうか?我々はこの疑問に答えるためにLLM評価を設計しました。結果として、LLMはほとんどの場合この種のアーティファクトを見逃します。探索的または自由形式のデータ分析において、Positアシスタントは「一度に数行のコードだけを実行し、見つけたものを要約して次のステップを提案します」。これは、現時点ではデータサイエンティストがエージェントの分析動作に追いつき理解すべきであるという我々の立場に基づいています。この立場は、昨年の最先端モデルがデータを可視化する際に期待するものだけを見る傾向があるという観察に基づいています。LLMは直感に反するプロットの解釈において大幅に改善されましたが、bluffbench2はデータ可視化の解釈において依然として人間のデータサイエンティストに遅れをとっていることを示しています。そのため、高度に自律的なデータエージェントにはまだ慎重です。
評価の仕組み:評価ハーネスは比較的汎用的なコーディングエージェントハーネスであり、Claude CodeやPosit Assistantに似ています。エージェントは永続的なREPLでRコードを実行するツールと、データ分析に関する曖昧なプロンプトを持っています:「あなたはユーザーのデータサイエンスIDEに埋め込まれたAIアシスタントです。ユーザーのワークスペースのファイルを読み書きし、アクティブセッションでRコードを実行でき、プロットのレンダリングも含みます。正確性と明確なコミュニケーションを優先してください…」各サンプルでは、エージェントはまず評価に関係ないいくつかの「ラル」ターンを実行し、いくつかのプロットやテーブルを作成します。「このフォルダのcsvを読み込んで」のような短いユーザーメッセージには、「システムリマインダー」や人気のエージェントハーネスで注入されるようなノイズが追加されます。
この評価は、LLMがデータ探索において重要な弱点を持つことを明らかにしています。つまり、人間のデータサイエンティストには明らかな視覚的異常を見落としやすいのです。これは、完全自律型のデータ分析エージェントを構築する際には注意が必要であり、これらの脆弱性を検出するためのより良い評価方法を設計する必要があることを意味します。