面向LLM智能体的轮廓图记忆:通过叙事轮廓实现隐式跨实体遍历
一篇新论文提出了MemHop多跳记忆基准和ProGraph两层记忆架构,结合轮廓扩展和压缩残差,显著提升了LLM智能体的长期记忆能力。ProGraph在MemHop和LoCoMo基准上均取得优异结果,超越现有方法。
大语言模型(LLM)智能体在跨会话交互中需要长期记忆,但现有的记忆基准主要评估单跳回忆,忽略了多跳关联。针对这一不足,来自Shengtong Zhu的研究团队提出了MemHop多跳记忆基准和ProGraph轮廓图记忆架构。MemHop基准包含1000个问题,覆盖10个社交网络场景,跳数深度从1到5,并为每个跳提供了证据注释,确保评估的准确性。这些场景模拟了现实社交网络中的复杂关系,如朋友的朋友、间接联系等,旨在测试智能体在多个实体间进行关联推理的能力。ProGraph是一种两层记忆架构:第一层是轮廓扩展,通过子串匹配遍历LLM撰写的叙事轮廓中自然出现的实体名称,无需显式构建知识图谱,大大降低了计算成本;第二层是压缩残差,在每次轮廓更新时零成本提取精确日期、数量和命名项,从而保留关键细节。消融实验表明,移除轮廓扩展后,MultiHop推理性能下降22.6个百分点,而不提取压缩残差时,LoCoMo上的精确召回下降8.6个百分点,交叉效应小于3个百分点,证明两种机制各有专长。ProGraph在MemHop上达到80.1%(与全上下文参考持平),在LoCoMo上达到78.4%(超出全上下文参考11.3个百分点),全面优于Mem0、A-Mem、HippoRAG和RAG。研究团队已公开MemHop基准、ProGraph实现及基线代码,为LLM智能体长期记忆研究提供了新的评估工具和解决方案。这一成果对提升AI代理的上下文理解能力具有重要意义,有望推动更复杂多跳推理任务的发展,尤其是在需要跨实体、跨时间推理的场景中。此外,ProGraph架构设计巧妙,利用了LLM本身生成的叙事轮廓,无需额外标注,具有很好的可扩展性。未来的工作可以探索如何将这种记忆架构与更多类型的LLM集成,以及如何应用于实际产品中,如虚拟助手、游戏NPC等。总结来说,ProGraph提供了一种高效、低成本且性能优异的长期记忆解决方案,为LLM智能体的发展开辟了新道路。