TeamTR:用於多智慧體LLM協調的信任區域微調
本文提出TeamTR,一種信任區域框架,用於解決多智慧體LLM系統在順序微調中的結構失效問題——即智慧體更新導致上下文分佈偏移,且基於快取的評估會加劇誤差。TeamTR透過重新取樣軌跡和智慧體散度控制,實現了每步改進的下界保證,平均效能提升7.1%。
多智慧體大語言模型(LLM)系統在複雜推理任務中展現了巨大潛力,但近期的評估揭示了一個令人驚訝的現象:它們往往不如單模型基線。研究人員深入探究後發現,在共享上下文的團隊中進行順序微調時,存在一種結構性失效模式。具體來說,當團隊中一個智慧體被更新時,整個團隊的上下文分佈會發生偏移,而後續的更新如果基於快取的歷史軌跡進行評估,這種不匹配就會不斷累積,導致效能退化。該研究將這一現象形式化為“複合佔用偏移”,並提供了嚴格的數學證明:基於陳舊佔用的評估會產生與智慧體數量成二次方的懲罰,而基於中間佔用的評估則可將懲罰降至線性規模。這一發現揭示了多智慧體系統協調困難的根本原因。
為了解決這一核心問題,研究團隊提出了TeamTR——一種基於信任區域的微調框架。TeamTR的核心創新在於:在每次元件更新後,立即重新取樣軌跡以確保評估基於最新的上下文分佈,同時對每個智慧體施加散度控制,防止更新幅度過大破壞協調。這保證了每次更新和每個訓練階段都有嚴格的改進下界。在多個基準任務上的實驗表明,TeamTR平均優於單智慧體和順序微調基線7.1%,有效緩解了協調退化問題。此外,TeamTR支援即插即用的元件替換,使得系統可以靈活地升級或更換單個智慧體模組。該工作已被ICML 2026接收,9頁的論文詳細闡述了理論分析和實驗驗證,開原始碼也已釋出在GitHub上,為多智慧體LLM的研究和部署提供了堅實的技術基礎。