AgentAtlas:超越LLM智能體的結果排行榜
本文介紹了AgentAtlas框架,該框架通過四個組成部分來評估LLM智能體:六狀態控制決策分類法、九類軌跡失敗分類法、分類法感知與盲法比較方法以及基準覆蓋審計。實驗表明,移除顯式標籤菜單後,所有模型的軌跡準確率下降14-40個百分點,落在0.54-0.62的狹窄區間,且沒有模型在所有指標上獲勝。
近年來,大型語言模型(LLM)智能體被廣泛應用於代碼庫、瀏覽器、操作系統、日曆、文件系統和工具生態系統中。然而,用於評估這些智能體的基準測試卻分散且不統一:每個基準側重不同的衡量標準,如最終任務成功率、工具調用有效性、重複運行一致性、軌跡安全性或對抗魯棒性。2024-2025年的多項研究已達成共識:單一的準確率指標已不足以比較可部署的智能體。為此,AgentAtlas框架應運而生,旨在超越傳統結果排行榜。
AgentAtlas包含四個關鍵組成部分。首先,它提出了一個六狀態控制決策分類法,將智能體的決策分為行為(Act)、詢問(Ask)、拒絕(Refuse)、停止(Stop)、確認(Confirm)和恢復(Recover)六類。這一分類法有助於系統性地描述智能體在不同情境下的行為模式。
其次,AgentAtlas引入了一個九類軌跡失敗分類法,並附帶兩個正交層次標籤:主要錯誤源(primary_error_source)和影響(impact)。這使得研究者能夠深入分析智能體失敗的根本原因及其後果,而不僅僅是記錄失敗的發生。
第三,AgentAtlas設計了分類法感知(taxonomy-aware)與分類法盲(taxonomy-blind)的對比方法。通過比較這兩種提示模式下的智能體表現,可以量化模型能力中有多少直接來自提示中的明確監督。實驗表明,當移除顯式的標籤菜單後,所有模型的軌跡準確率下降了14到40個百分點,最終穩定在0.54-0.62的狹窄區間內,無論模型家族如何。這一發現揭示了當前評估方法可能高估了模型的內在能力。
最後,AgentAtlas還進行了一項基準覆蓋審計,將15個智能體基準與六個行為軸進行映射,揭示了現有基準的覆蓋盲區。
在實驗中,研究者使用了8個模型(4個前沿閉源模型和4個開源模型),在兩種提示模式下生成了1342個測試項。結果顯示,沒有單一模型能在控制準確率、軌跡診斷和工具上下文效用保留這三個維度上同時取得最佳成績。這表明,當前智能體的能力評估需要更全面的框架,而非單一的排行榜。
AgentAtlas的價值在於提供了一個系統性的評估協議。論文作者強調,該研究是測量協議的示範,而非新基準的發佈。未來,這一框架可能推動智能體評估向更細粒度、更可解釋的方向發展。