面向LLM智能體的輪廓圖記憶:通過敍事輪廓實現隱式跨實體遍歷
一篇新論文提出了MemHop多跳記憶基準和ProGraph兩層記憶架構,結合輪廓擴展和壓縮殘差,顯著提升了LLM智能體的長期記憶能力。ProGraph在MemHop和LoCoMo基準上均取得優異結果,超越現有方法。
大語言模型(LLM)智能體在跨會話交互中需要長期記憶,但現有的記憶基準主要評估單跳回憶,忽略了多跳關聯。針對這一不足,來自Shengtong Zhu的研究團隊提出了MemHop多跳記憶基準和ProGraph輪廓圖記憶架構。MemHop基準包含1000個問題,覆蓋10個社交網絡場景,跳數深度從1到5,併為每個跳提供了證據註釋,確保評估的準確性。這些場景模擬了現實社交網絡中的複雜關係,如朋友的朋友、間接聯繫等,旨在測試智能體在多個實體間進行關聯推理的能力。ProGraph是一種兩層記憶架構:第一層是輪廓擴展,通過子串匹配遍歷LLM撰寫的敍事輪廓中自然出現的實體名稱,無需顯式構建知識圖譜,大大降低了計算成本;第二層是壓縮殘差,在每次輪廓更新時零成本提取精確日期、數量和命名項,從而保留關鍵細節。消融實驗表明,移除輪廓擴展後,MultiHop推理性能下降22.6個百分點,而不提取壓縮殘差時,LoCoMo上的精確召回下降8.6個百分點,交叉效應小於3個百分點,證明兩種機制各有專長。ProGraph在MemHop上達到80.1%(與全上下文參考持平),在LoCoMo上達到78.4%(超出全上下文參考11.3個百分點),全面優於Mem0、A-Mem、HippoRAG和RAG。研究團隊已公開MemHop基準、ProGraph實現及基線代碼,為LLM智能體長期記憶研究提供了新的評估工具和解決方案。這一成果對提升AI代理的上下文理解能力具有重要意義,有望推動更復雜多跳推理任務的發展,尤其是在需要跨實體、跨時間推理的場景中。此外,ProGraph架構設計巧妙,利用了LLM本身生成的敍事輪廓,無需額外標註,具有很好的可擴展性。未來的工作可以探索如何將這種記憶架構與更多類型的LLM集成,以及如何應用於實際產品中,如虛擬助手、遊戲NPC等。總結來説,ProGraph提供了一種高效、低成本且性能優異的長期記憶解決方案,為LLM智能體的發展開闢了新道路。