AI News HubLIVE
站內改寫1 分鐘閱讀

面向LLM智慧體的輪廓圖記憶:透過敘事輪廓實現隱式跨實體遍歷

一篇新論文提出了MemHop多跳記憶基準和ProGraph兩層記憶架構,結合輪廓擴充套件和壓縮殘差,顯著提升了LLM智慧體的長期記憶能力。ProGraph在MemHop和LoCoMo基準上均取得優異結果,超越現有方法。

來源arXiv AI作者: Shengtong Zhu

大語言模型(LLM)智慧體在跨會話互動中需要長期記憶,但現有的記憶基準主要評估單跳回憶,忽略了多跳關聯。針對這一不足,來自Shengtong Zhu的研究團隊提出了MemHop多跳記憶基準和ProGraph輪廓圖記憶架構。MemHop基準包含1000個問題,覆蓋10個社交網路場景,跳數深度從1到5,併為每個跳提供了證據註釋,確保評估的準確性。這些場景模擬了現實社交網路中的複雜關係,如朋友的朋友、間接聯絡等,旨在測試智慧體在多個實體間進行關聯推理的能力。ProGraph是一種兩層記憶架構:第一層是輪廓擴充套件,透過子串匹配遍歷LLM撰寫的敘事輪廓中自然出現的實體名稱,無需顯式構建知識圖譜,大大降低了計算成本;第二層是壓縮殘差,在每次輪廓更新時零成本提取精確日期、數量和命名項,從而保留關鍵細節。消融實驗表明,移除輪廓擴充套件後,MultiHop推理效能下降22.6個百分點,而不提取壓縮殘差時,LoCoMo上的精確召回下降8.6個百分點,交叉效應小於3個百分點,證明兩種機制各有專長。ProGraph在MemHop上達到80.1%(與全上下文參考持平),在LoCoMo上達到78.4%(超出全上下文參考11.3個百分點),全面優於Mem0、A-Mem、HippoRAG和RAG。研究團隊已公開MemHop基準、ProGraph實現及基線程式碼,為LLM智慧體長期記憶研究提供了新的評估工具和解決方案。這一成果對提升AI代理的上下文理解能力具有重要意義,有望推動更復雜多跳推理任務的發展,尤其是在需要跨實體、跨時間推理的場景中。此外,ProGraph架構設計巧妙,利用了LLM本身生成的敘事輪廓,無需額外標註,具有很好的可擴充套件性。未來的工作可以探索如何將這種記憶架構與更多型別的LLM整合,以及如何應用於實際產品中,如虛擬助手、遊戲NPC等。總結來說,ProGraph提供了一種高效、低成本且效能優異的長期記憶解決方案,為LLM智慧體的發展開闢了新道路。