GraphRAG 過於複雜:我們實際用來構建知識圖譜的方法
本文探討了企業級 AI “公司大腦”構建中的檢索增強生成(RAG)技術侷限性,指出標準 RAG 僅擅長處理單一事實類問題,而 GraphRAG 雖然理論上能解決多文件綜合問題,但其高昂成本、狹窄優勢及實體解析難題使其在多數場景下過於複雜。作者介紹了其公司 QX Labs 的替代方案:“類圖 RAG”——一種基於普通資料庫的輕量級實體-關係系統,無需圖資料庫、預建圖譜或自定義本體,透過惰性總結、固定本體和實體解析瀑布流實現自服務部署,顯著降低了成本與運維負擔。
在構建企業級 AI “公司大腦”時,GraphRAG 曾被視為終極解決方案,但本文作者 Jai Juneja 透過實踐指出,這項技術過於複雜且成本高昂,實際應用效果有限。作者從三種問題型別出發,剖析了標準 RAG 的不足,並分享了 QX Labs 的輕量級替代方案。
標準 RAG 透過將文件切分為段落並轉換為向量進行語義檢索,在單一事實問題(如“2017 年估值備忘錄中的接受率是多少?”)上表現出色。然而,企業真正需要解決的是“組合問題”(如“關於 Acme 公司我們瞭解多少?”)和“計數問題”(如“我們評估過哪些金融科技公司?”),這些需要跨文件綜合或精確列舉的任務,RAG 往往只能給出片面答案。這類問題佔據了大部分業務價值,但標準 RAG 無法勝任。
GraphRAG 透過預建知識圖譜試圖彌補這一缺陷:它將文件中的實體(公司、人物、產品)提取為節點,關係為邊,並預生成聚類摘要。但微軟研究顯示,其索引成本是普通向量索引的 0.1%,而後續的 LazyGraphRAG 表明,惰性方法可在全球性問題回答質量上媲美完整 GraphRAG,且查詢成本極低。此外,實體解析(如將“Acme”“ACME Holdings Inc.”合併為一個節點)在現有工具中仍是難題,出錯會導致圖譜碎片化或合併錯誤。更糟的是,圖資料庫帶來了額外的運維負擔。
QX Labs 的“類圖 RAG”保留了知識圖譜中經過驗證的部分,摒棄了不必要的複雜性:所有資料儲存在普通資料庫和搜尋索引中,實體型別固定為六類(公司、人物、產品、專案、事件、地點),關係透過協同出現頻率自動計算,無需圖查詢語言。實體解析採用瀑布流策略:優先精確匹配,其次相似度搜尋,僅當存在歧義時呼叫小型 AI 模型判斷,且合併操作可逆。摘要僅在被查詢時才生成,將成本與查詢次數掛鉤,而非語料規模。
該系統透過代理路由工具回答問題:針對單一事實、實體查詢、關聯擴充套件和全域計數,使用者可觀察推理鏈路。評估表明,它在標準 RAG 擅長的單一事實問題上保持高水平,同時在組合和計數問題上實現顯著提升。儘管不擅長深度多跳推理,且關係僅為協同出現而非型別化,但對於大多數企業而言,這種折中方案捕獲了 GraphRAG 的大部分價值,且無需沉重的運維負擔。全文以“GraphRAG 是一個好的想法,但穿上了過多的架構外衣”點題,強調應取其思想、棄其架構。此外,系統支援自服務部署,使用者只需連線資料來源即可使用,無需設計模式或標註資料。成本隨著查詢量而非資料量增長,適合文件動態變化的企業環境。