LLMs 常常忽略数据可视化中的细微视觉伪影
一项评估显示,前沿的LLMs在数据可视化中常常无法检测到细微的视觉伪影,比如由于数据插补导致的点完美对齐。这提醒我们在实现完全自主的数据分析代理时仍需谨慎。
想象一下,当您首次接收患者数据并将其加载到R或Python中时,为了解数据,您绘制了一些图表,然后偶然发现这样一个图:大部分看起来正常,但有几个点完美地排列在一条看起来像是“拟合”的线上。进一步调查后,您意识到这些行来自某个研究站点,其胆固醇值是被插补的。您将这些值设为NA,然后继续分析。
如今的前沿LLM能否注意到这种异常?为此,我们设计了一个LLM评估。结果发现,LLM大多会忽略这类伪影。在探索性或开放式数据分析中,Posit助手“每次只运行少量代码,然后总结发现并提出下一步建议”。这源于我们的立场:目前,数据科学家应该跟上并理解代理在分析数据时的操作。这一立场最初基于我们去年的观察——前沿模型在可视化数据时往往只看到预期的东西。尽管LLM在解读反直觉图表方面有了显著提升,但bluffbench2显示它们在解释数据可视化上仍落后于人类数据科学家。因此,我们对高度自主的数据代理仍持谨慎态度。
评估工作原理如下:该评估框架是一个相对通用的编码代理框架,类似于Claude Code或Posit Assistant。代理拥有在持久REPL中运行R代码的工具,并接收一些模糊的数据分析提示,例如:“你是一个嵌入在用户数据科学IDE中的AI助手。你可以读取和修改用户工作区文件,并在用户活跃会话中执行R代码,包括渲染图表。优先保证正确性和清晰沟通……”在每个样本中,代理首先执行一些“平静”轮次,制作与评估无关的图表和表格。简短的用户消息(如“加载此文件夹中的csv”)会被装饰上“系统提醒”等由流行代理框架注入的噪声。
这项评估揭示了LLM在数据探索中的一个关键弱点:它们容易忽略数据中的视觉异常,而这些异常对于人类数据科学家来说可能显而易见。这意味着,在构建完全自主的数据分析代理时,我们需要保持谨慎,并设计更好的评估方法来检测这些漏洞。