記憶からスキルへ:エビデンスに基づく長期LLMエージェントの共進化ガバナンス
既存の長期LLMエージェントのメモリシステムは、過去のトレースを受動的なコンテキストとして取得するだけで、実行可能な能力に変換していません。本論文では、トレーニング不要のメモリ・スキル共進化フレームワークMSCEを提案し、エージェントの経験をグラウンディングされたステップトレース、再利用可能な手続きポリシー、宣言的環境認知に整理します。MSCEは証拠に基づくL2ポリシーを呼び出し可能なスキルに結晶化し、反射加重値バックフィリングを導入します。実験では、MSCEが最先端の手法を大幅に上回ります。
大規模言語モデル(LLM)を利用したエージェントの長期タスク実行において、メモリシステムの設計は重要な課題です。しかし、既存のシステムはエージェントの過去の経験を単に受動的なコンテキストとして保存し、必要な時に取り出すだけであり、それを実行可能なスキルに変換することができていません。この制限により、エージェントは新しいタスクに直面した際に過去の経験から再利用可能な能力を抽出することが難しく、長期タスクにおける適応性と効率が制限されています。
この問題に対処するため、複数の研究機関からなる共同研究チームは、MSCE(Memory-Skill Co-Evolution)フレームワークを提案しました。MSCEは追加のトレーニングを必要としない共進化フレームワークであり、その核心はエージェントの経験を3つの形式に体系的に整理することにあります:グラウンディングされたステップトレース、再利用可能な手続きポリシー、および宣言的環境認知です。この構造化された整理により、MSCEはエージェントの経験を再利用可能な能力に変換します。
具体的には、MSCEはまずエージェントの軌跡から証拠に基づくL2ポリシー(正の推定ゲインを持つ決定ルール)を抽出し、それらを「呼び出し可能なスキル」に結晶化します。各スキルは、証拠リンク、適用範囲の境界、決定ガイダンス、検証ルール、信頼性推定を保持し、スキルの信頼性とトレーサビリティを保証します。さらに、MSCEは「反射加重値バックフィリング」と呼ばれるメカニズムを導入します。このメカニズムは、疎な終端フィードバック信号を密な局所的な自己反射を通じて伝播させ、証拠に較正された軌跡値を生成し、メモリとスキルの進化を導きます。
MSCEの性能を検証するため、研究チームはEvoAgentBenchとLoCoMoの2つのベンチマークで実験を行いました。結果は、MSCEがすべてのタスクにおいて現在の最先端のスキル拡張型エージェントおよびメモリ駆動型エージェントのベースラインを大幅に上回り、強力なドメイン間転送能力と生涯進化能力を示しました。この研究は、長期LLMエージェントの自律学習と能力進化に新たな方向性を提供し、ロボット制御、バーチャルアシスタント、複雑なタスク計画などの分野での応用が期待されます。