AI News HubLIVE
站内改写1 分钟阅读

BatchDAG:基于LLM规划的执行图用于企业数据可扩展即席分析

BatchDAG是一种新系统,利用LLM生成操作有向无环图(DAG),结合实体感知批量处理,将LLM调用减少高达47倍,在企业规模数据分析中优于传统方法和ReAct代理。

来源arXiv AI作者: Anupreet Walia

大型语言模型(LLM)在分析单个文档时表现出色,但在处理企业级数据集上的全面、跨实体分析问题时,常常因为上下文溢出、每个实体的归因丢失以及顺序工具调用导致的线性延迟而失败。为了解决这些挑战,研究人员提出了BatchDAG系统。该系统让LLM生成一个类型化的有向无环图(DAG),其中包含SQL查询、语义搜索、内存转换、并行扇出和单次分析等操作。一个确定性引擎使用拓扑波并行性和结构化JSON数据流来评估这个DAG,从而实现了高效且可扩展的执行。

BatchDAG的关键优化是实体感知批量处理,它在扇出之前按逻辑实体对行进行分组,从而将LLM调用次数减少高达47倍。这一优化显著降低了推理成本,使得系统能够处理大规模数据集。BatchDAG并非主要针对手工优化管道的准确性改进,而是一个通用编排层,用单一系统替代多个手工设计的工作流,能够根据自然语言生成合适的执行策略。

在12个转录密集型查询的受控实验中,BatchDAG获得了3.74/5的质量评分,与专家设计管道(3.25/5)相当,并显著优于ReAct代理(3.09/5,p<0.01)。此外,BatchDAG在溯源方面表现更佳,其转录证据率达到77%,而基线方法仅为46-60%。一项受控消融研究表明,使用结构化JSON中间体比散文摘要减少了27%的幻觉(配对t检验,p=0.107,n=12)。规划器在300次规划调用中实现了98.8%的有效DAG率,显示了其高可靠性。

在实际部署中,BatchDAG在Brevian.ai的生产环境中处理超过5万条会议记录的查询,用时不到60秒。根据公布的GPT-5.1定价,每次查询的测量成本为0.02至0.24美元。这表明BatchDAG不仅提高了分析质量,还显著降低了运营成本,为企业级数据分析提供了一种高效且经济的解决方案。