多模态CoLRAG-TF:用于复杂PDF的三重过滤检索
本文提出多模态CoLRAG-TF,一种四轴融合架构,集成密集文本嵌入、BM25关键词匹配、知识图谱三元组过滤和图像相似度,用于复杂PDF的鲁棒检索。系统在43份日本灾难教训PDF上构建了2403个块的多模态索引,并提取11414个OpenIE三元组以支持组合推理。贝叶斯优化显示三元组轴必须占主导(α=0.44)以抵消词汇偏差。在457对基准上,检索召回率达到0.9909,多跳答案相似度比单跳提高71.6%。
检索增强生成(RAG)在处理异构PDF集合时面临诸多挑战,包括多模态内容、领域特定术语以及跨分散证据的多跳推理需求。针对这些问题,Takato Yasuno提出了多模态CoLRAG-TF系统,这是一种四轴融合架构,旨在实现复杂文档的鲁棒检索。该系统通过集成四种检索策略来应对这些挑战:密集文本嵌入、BM25关键词匹配、知识图谱三元组过滤和图像相似度。首先,系统从43份日本灾害教训PDF中提取了2403个块,并利用混合OCR流水线和基于大语言模型的标题生成技术构建了多模态索引。为了增强组合推理能力,系统进一步提取了11414个OpenIE三元组,并使用FAISS进行索引,实现了亚秒级的三元组查找和相关性信号的分层传播。在检索过程中,系统采用受HippoRAG2启发的粗到细检索器,按卷→章节→块的顺序逐步缩小搜索空间,最后进行融合评分。通过贝叶斯优化确定各轴的融合权重,结果发现三元组轴必须占据主导地位(α=0.44),以抵消词汇偏差并维持多跳检索质量。在457对基准测试中,多模态CoLRAG-TF取得了0.9909的检索召回率,并且多跳答案相似度较单跳查询提升了71.6%。此外,该系统还展示了图像到教训的流水线,利用视觉大语言模型处理视觉输入,证明了该方法在灾难领域之外的广泛应用潜力。这些结果表明,三重过滤的多模态融合对于在嘈杂、异构PDF上进行结构化推理至关重要。该框架不仅限于灾难领域,还可以推广到其他需要多跳推理的复杂文档检索场景。通过结合多种模态和粗到细的检索策略,CoLRAG-TF显著提升了检索质量和效率,为RAG系统在处理异构PDF时提供了一种有效的解决方案。