AI News HubLIVE
站内改写1 分钟阅读

从记忆到技能:基于证据的长期LLM代理协同进化治理

现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。

来源arXiv Computational Linguistics作者: Bo Tang, Yang Zhang, Guomian Zhuang, Wenqiang Wei, Gaoyang Zheng, Lindong Xie, Yanchao Tan, Feiyu Xiong, Qingyu Yang, Edward Chung, Zhiyu li

在长期大语言模型(LLM)代理的研究中,记忆系统的设计至关重要。然而,现有系统往往将代理的先前经验轨迹简单地存储为被动上下文,在需要时进行检索,却未能将其转化为可直接执行的技能。这种局限使得代理在面对新任务时,难以从历史经验中提取可复用的能力,从而限制了其在长期任务中的适应性和效率。

针对这一问题,来自多所机构的联合研究团队提出了一种名为MSCE(Memory-Skill Co-Evolution)的框架。MSCE是一个无需额外训练的协同进化框架,其核心思想是将代理的经验系统地组织为三种形式:基础步骤轨迹(grounded step traces)、可重用过程策略(reusable procedural policies)以及声明性环境认知(declarative environmental cognition)。通过这种结构化组织,MSCE能够将代理的经验转化为可复用的能力。

具体而言,MSCE首先从代理的轨迹中提取出带有证据支持的L2级别策略(即二级策略,具有正估计增益的决策规则),然后将这些策略结晶为“可调用技能”。每个技能都保留了完整的证据链接、适用范围边界、决策指导、验证规则以及可靠性估计,从而确保技能的可信度和可追溯性。此外,MSCE还引入了一种名为“反射加权值回填”(reflection-weighted value backfilling)的机制。该机制将稀疏的终端反馈信号通过密集的局部自我反思进行传播,从而产生经过证据校准的轨迹值,用于指导记忆和技能的进化。

为了验证MSCE的性能,研究团队在EvoAgentBench和LoCoMo两个基准测试上进行了实验。结果表明,MSCE在所有任务上均显著优于当前最先进的技能增强型代理和记忆驱动型代理基线,展现出强大的跨领域迁移能力和终身进化能力。这一工作为长期LLM代理的自主学习和能力进化提供了新的思路,有望在机器人控制、虚拟助手和复杂任务规划等领域发挥重要作用。