LLMs 常常忽略數據可視化中的細微視覺偽影
一項評估顯示,前沿的LLMs在數據可視化中常常無法檢測到細微的視覺偽影,比如由於數據插補導致的點完美對齊。這提醒我們在實現完全自主的數據分析代理時仍需謹慎。
想象一下,當您首次接收患者數據並將其加載到R或Python中時,為了解數據,您繪製了一些圖表,然後偶然發現這樣一個圖:大部分看起來正常,但有幾個點完美地排列在一條看起來像是“擬合”的線上。進一步調查後,您意識到這些行來自某個研究站點,其膽固醇值是被插補的。您將這些值設為NA,然後繼續分析。
如今的前沿LLM能否注意到這種異常?為此,我們設計了一個LLM評估。結果發現,LLM大多會忽略這類偽影。在探索性或開放式數據分析中,Posit助手“每次只運行少量代碼,然後總結髮現並提出下一步建議”。這源於我們的立場:目前,數據科學家應該跟上並理解代理在分析數據時的操作。這一立場最初基於我們去年的觀察——前沿模型在可視化數據時往往只看到預期的東西。儘管LLM在解讀反直覺圖表方面有了顯著提升,但bluffbench2顯示它們在解釋數據可視化上仍落後於人類數據科學家。因此,我們對高度自主的數據代理仍持謹慎態度。
評估工作原理如下:該評估框架是一個相對通用的編碼代理框架,類似於Claude Code或Posit Assistant。代理擁有在持久REPL中運行R代碼的工具,並接收一些模糊的數據分析提示,例如:“你是一個嵌入在用户數據科學IDE中的AI助手。你可以讀取和修改用户工作區文件,並在用户活躍會話中執行R代碼,包括渲染圖表。優先保證正確性和清晰溝通……”在每個樣本中,代理首先執行一些“平靜”輪次,製作與評估無關的圖表和表格。簡短的用户消息(如“加載此文件夾中的csv”)會被裝飾上“系統提醒”等由流行代理框架注入的噪聲。
這項評估揭示了LLM在數據探索中的一個關鍵弱點:它們容易忽略數據中的視覺異常,而這些異常對於人類數據科學家來説可能顯而易見。這意味着,在構建完全自主的數據分析代理時,我們需要保持謹慎,並設計更好的評估方法來檢測這些漏洞。