AI News HubLIVE
站內改寫1 分鐘閱讀

TeamTR:用於多智能體LLM協調的信任區域微調

本文提出TeamTR,一種信任區域框架,用於解決多智能體LLM系統在順序微調中的結構失效問題——即智能體更新導致上下文分佈偏移,且基於緩存的評估會加劇誤差。TeamTR通過重新採樣軌跡和智能體散度控制,實現了每步改進的下界保證,平均性能提升7.1%。

來源arXiv Machine Learning作者: Yi Xie, Siao Liu, Falong Fan, Yuanqi Yao, Yue Zhao, Bo Liu

多智能體大語言模型(LLM)系統在複雜推理任務中展現了巨大潛力,但近期的評估揭示了一個令人驚訝的現象:它們往往不如單模型基線。研究人員深入探究後發現,在共享上下文的團隊中進行順序微調時,存在一種結構性失效模式。具體來説,當團隊中一個智能體被更新時,整個團隊的上下文分佈會發生偏移,而後續的更新如果基於緩存的歷史軌跡進行評估,這種不匹配就會不斷累積,導致性能退化。該研究將這一現象形式化為“複合佔用偏移”,並提供了嚴格的數學證明:基於陳舊佔用的評估會產生與智能體數量成二次方的懲罰,而基於中間佔用的評估則可將懲罰降至線性規模。這一發現揭示了多智能體系統協調困難的根本原因。

為了解決這一核心問題,研究團隊提出了TeamTR——一種基於信任區域的微調框架。TeamTR的核心創新在於:在每次組件更新後,立即重新採樣軌跡以確保評估基於最新的上下文分佈,同時對每個智能體施加散度控制,防止更新幅度過大破壞協調。這保證了每次更新和每個訓練階段都有嚴格的改進下界。在多個基準任務上的實驗表明,TeamTR平均優於單智能體和順序微調基線7.1%,有效緩解了協調退化問題。此外,TeamTR支持即插即用的組件替換,使得系統可以靈活地升級或更換單個智能體模塊。該工作已被ICML 2026接收,9頁的論文詳細闡述了理論分析和實驗驗證,開源代碼也已發佈在GitHub上,為多智能體LLM的研究和部署提供了堅實的技術基礎。