LLMs 常常忽略資料視覺化中的細微視覺偽影
一項評估顯示,前沿的LLMs在資料視覺化中常常無法檢測到細微的視覺偽影,比如由於資料插補導致的點完美對齊。這提醒我們在實現完全自主的資料分析代理時仍需謹慎。
想象一下,當您首次接收患者資料並將其載入到R或Python中時,為了解資料,您繪製了一些圖表,然後偶然發現這樣一個圖:大部分看起來正常,但有幾個點完美地排列在一條看起來像是“擬合”的線上。進一步調查後,您意識到這些行來自某個研究站點,其膽固醇值是被插補的。您將這些值設為NA,然後繼續分析。
如今的前沿LLM能否注意到這種異常?為此,我們設計了一個LLM評估。結果發現,LLM大多會忽略這類偽影。在探索性或開放式資料分析中,Posit助手“每次只執行少量程式碼,然後總結髮現並提出下一步建議”。這源於我們的立場:目前,資料科學家應該跟上並理解代理在分析資料時的操作。這一立場最初基於我們去年的觀察——前沿模型在視覺化資料時往往只看到預期的東西。儘管LLM在解讀反直覺圖表方面有了顯著提升,但bluffbench2顯示它們在解釋資料視覺化上仍落後於人類資料科學家。因此,我們對高度自主的資料代理仍持謹慎態度。
評估工作原理如下:該評估框架是一個相對通用的編碼代理框架,類似於Claude Code或Posit Assistant。代理擁有在持久REPL中執行R程式碼的工具,並接收一些模糊的資料分析提示,例如:“你是一個嵌入在使用者資料科學IDE中的AI助手。你可以讀取和修改使用者工作區檔案,並在使用者活躍會話中執行R程式碼,包括渲染圖表。優先保證正確性和清晰溝通……”在每個樣本中,代理首先執行一些“平靜”輪次,製作與評估無關的圖表和表格。簡短的使用者訊息(如“載入此資料夾中的csv”)會被裝飾上“系統提醒”等由流行代理框架注入的噪聲。
這項評估揭示了LLM在資料探索中的一個關鍵弱點:它們容易忽略資料中的視覺異常,而這些異常對於人類資料科學家來說可能顯而易見。這意味著,在構建完全自主的資料分析代理時,我們需要保持謹慎,並設計更好的評估方法來檢測這些漏洞。