AI News HubLIVE
站內改寫1 分鐘閱讀

從記憶到技能:基於證據的長期LLM代理協同進化治理

現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和聲明性環境認知。MSCE將具有正估計增益的證據支持的L2策略結晶為可調用技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。

來源arXiv Computational Linguistics作者: Bo Tang, Yang Zhang, Guomian Zhuang, Wenqiang Wei, Gaoyang Zheng, Lindong Xie, Yanchao Tan, Feiyu Xiong, Qingyu Yang, Edward Chung, Zhiyu li

在長期大語言模型(LLM)代理的研究中,記憶系統的設計至關重要。然而,現有系統往往將代理的先前經驗軌跡簡單地存儲為被動上下文,在需要時進行檢索,卻未能將其轉化為可直接執行的技能。這種侷限使得代理在面對新任務時,難以從歷史經驗中提取可複用的能力,從而限制了其在長期任務中的適應性和效率。

針對這一問題,來自多所機構的聯合研究團隊提出了一種名為MSCE(Memory-Skill Co-Evolution)的框架。MSCE是一個無需額外訓練的協同進化框架,其核心思想是將代理的經驗系統地組織為三種形式:基礎步驟軌跡(grounded step traces)、可重用過程策略(reusable procedural policies)以及聲明性環境認知(declarative environmental cognition)。通過這種結構化組織,MSCE能夠將代理的經驗轉化為可複用的能力。

具體而言,MSCE首先從代理的軌跡中提取出帶有證據支持的L2級別策略(即二級策略,具有正估計增益的決策規則),然後將這些策略結晶為“可調用技能”。每個技能都保留了完整的證據鏈接、適用範圍邊界、決策指導、驗證規則以及可靠性估計,從而確保技能的可信度和可追溯性。此外,MSCE還引入了一種名為“反射加權值回填”(reflection-weighted value backfilling)的機制。該機制將稀疏的終端反饋信號通過密集的局部自我反思進行傳播,從而產生經過證據校準的軌跡值,用於指導記憶和技能的進化。

為了驗證MSCE的性能,研究團隊在EvoAgentBench和LoCoMo兩個基準測試上進行了實驗。結果表明,MSCE在所有任務上均顯著優於當前最先進的技能增強型代理和記憶驅動型代理基線,展現出強大的跨領域遷移能力和終身進化能力。這一工作為長期LLM代理的自主學習和能力進化提供了新的思路,有望在機器人控制、虛擬助手和複雜任務規劃等領域發揮重要作用。