TeamTR:用于多智能体LLM协调的信任区域微调
本文提出TeamTR,一种信任区域框架,用于解决多智能体LLM系统在顺序微调中的结构失效问题——即智能体更新导致上下文分布偏移,且基于缓存的评估会加剧误差。TeamTR通过重新采样轨迹和智能体散度控制,实现了每步改进的下界保证,平均性能提升7.1%。
多智能体大语言模型(LLM)系统在复杂推理任务中展现了巨大潜力,但近期的评估揭示了一个令人惊讶的现象:它们往往不如单模型基线。研究人员深入探究后发现,在共享上下文的团队中进行顺序微调时,存在一种结构性失效模式。具体来说,当团队中一个智能体被更新时,整个团队的上下文分布会发生偏移,而后续的更新如果基于缓存的历史轨迹进行评估,这种不匹配就会不断累积,导致性能退化。该研究将这一现象形式化为“复合占用偏移”,并提供了严格的数学证明:基于陈旧占用的评估会产生与智能体数量成二次方的惩罚,而基于中间占用的评估则可将惩罚降至线性规模。这一发现揭示了多智能体系统协调困难的根本原因。
为了解决这一核心问题,研究团队提出了TeamTR——一种基于信任区域的微调框架。TeamTR的核心创新在于:在每次组件更新后,立即重新采样轨迹以确保评估基于最新的上下文分布,同时对每个智能体施加散度控制,防止更新幅度过大破坏协调。这保证了每次更新和每个训练阶段都有严格的改进下界。在多个基准任务上的实验表明,TeamTR平均优于单智能体和顺序微调基线7.1%,有效缓解了协调退化问题。此外,TeamTR支持即插即用的组件替换,使得系统可以灵活地升级或更换单个智能体模块。该工作已被ICML 2026接收,9页的论文详细阐述了理论分析和实验验证,开源代码也已发布在GitHub上,为多智能体LLM的研究和部署提供了坚实的技术基础。