AI News HubLIVE
站内改写2 分钟阅读

为什么前沿数据智能体在质量和成本上优于通用编码智能体

Databricks的Genie Code数据智能体在400多项真实数据任务中,准确率达76.6%,平均每次任务成本仅0.55美元,远低于通用编码智能体。其优势在于对工作区上下文的深度语义理解,避免了低效探索。

Databricks近期发布了一篇博客,详细介绍了其数据智能体Genie Code在与通用编码智能体的对比评估中的出色表现。Genie Code是Databricks为数据工作全流程设计的智能体,涵盖基础数据分析、工作区级数据探索以及数据工程任务,如构建管道、调试故障和交付仪表板。在此次评估中,研究团队从实际内部使用中提炼了401个自包含任务,包括日常问题、资产发现、代码编写与修改、调试、解释现有代码以及精确数据查找等场景。所有任务均以20分钟的实际时间预算运行,并由独立评审员根据回答的正确性和有用性进行评分。

结果显示,Genie Code不仅准确率最高(76.6%),而且成本最低,平均每次任务仅需0.55美元。相比之下,三个通用编码智能体(称为Agent X、Agent Y和Agent Z)的准确率分别为72.1%、55.9%和56.1%,平均每次任务成本分别为1.09美元、0.91美元和1.16美元。Genie Code的正确回答成本不到Agent X的一半,而Agent Y和Z的准确率被长时运行扫描的墙钟超时严重拖累,这些超时往往源于对大型低效表的无上限查询。

这种优势的关键在于Genie Code对Databricks工作区上下文的深度语义理解。通用编码智能体在面对复杂任务时,往往陷入盲目的全表扫描或随机探索,导致高令牌消耗和低准确率。而Genie Code利用语义搜索和持久记忆,能够直接定位正确的资产,平均每次任务仅需8.3次工具调用,远低于其他智能体。例如,在某次任务中,Genie Code通过语义搜索和元数据快速找到正确的表,编写一条SQL查询,仅用五次工具调用就得到正确答案,而三个通用智能体均未能从探索中恢复。

研究团队原本预期准确率和成本之间存在权衡,但Genie Code打破了这一假设。通过减少不必要的令牌消耗和调用次数,它在提升准确性的同时降低了成本。博客还指出,通用基准测试无法完全反映用户的日常体验,Databricks将持续基于真实任务扩展评估,并分享更多发现。Genie Code的Ontology功能虽然尚未全球可用,但未来有望进一步强化其优势。总之,Genie Code作为前沿数据智能体,专为Databricks工作区这类高度动态和模糊的环境优化,能够同时提升准确性、速度和成本效率,而无需在通用能力上做出妥协。