DecisionBench:長視界智慧工作流中的新興委託基準
DecisionBench 是一個用於評估長視界智慧工作流中新興委託能力的基準平臺。它固定了任務套件(GAIA、tau-bench、BFCL multi-turn)、模型池(11個模型,來自7個供應商家族)、委託介面(call_model及可選的read_profile通道)、確定性技能標註層以及多維指標套件(覆蓋質量、成本、延遲、委託率、路由保真度、供應商自我偏好及反事實委託上限)。該基準框架不依賴於代理資訊的生成或傳遞方式,因此可評估學習型路由器、富代理記憶、自適應配置檔案構建以及多步委託等方法。研究團隊在完整模型池上進行了五次條件參考掃描,共涉及23,375個任務例項。主要發現包括:(i) 在四種感知條件下,平均終端任務質量在統計上無顯著差異(|β| = 0.21),因此僅評估質量會忽略關鍵的編排訊號;(ii) 在平均質量接近的情況下,路由保真度(top-1)在7.5%到29.5%之間變化,且傳遞渠道(按需工具 vs. 預載入描述)對結果的影響大於描述內容本身;(iii) 反事實上限表明,完美委託在每項任務套件上的效能比當前測量值高出15到31個百分點,揭示了未來編排方法巨大的未開發空間。研究團隊已公開發布該基準平臺、標註層、參考干預套件、分析流水線以及220個按條件執行的存檔。
近日,一項名為 DecisionBench 的基準研究被提出,旨在評估長視界智慧工作流中的新興委託能力。該研究由 Yuxuan Gao 等五位作者共同完成,論文已提交至 arXiv(編號:2605.19099)。
DecisionBench 作為一個標準化基準平臺,固定了多項關鍵元件:任務套件包括 GAIA、tau-bench 和 BFCL multi-turn;模型池涵蓋11個模型,來自7個供應商家族,包括 OpenAI、Google、Anthropic、Meta、Mistral、Cohere 和 xAI 等;委託介面提供了 call_model 和可選的 read_profile 通道;此外還包含確定性技能標註層和多維指標套件,覆蓋質量、成本、延遲、委託率、路由保真度(top-k)、供應商自我偏好及反事實委託上限等。該平臺不依賴於代理資訊的生成或傳遞方式,因此可評估學習型路由器、富代理記憶、自適應配置檔案構建以及多步委託等方法。
研究團隊在完整模型池上進行了五次條件參考掃描,共涉及23,375個任務例項。這五次條件分別是:無感知(模型僅收到任務)、僅自我描述、僅表現資料、以及完整資料(自我描述加表現資料)。結果顯示了三個重要發現:首先,在四種感知條件下,平均終端任務質量在統計上無顯著差異(|β| = 0.21),因此僅評估質量會忽略關鍵的編排訊號。其次,在平均質量接近的情況下,路由保真度(top-1)在7.5%到29.5%之間變化,且傳遞渠道(按需工具 vs. 預載入描述)對結果的影響大於描述內容本身。具體而言,當使用按需工具傳遞代理資料時,路由準確性顯著高於預載入描述的方式。最後,反事實上限表明,完美委託在每項任務套件上的效能比當前測量值高出15到31個百分點,揭示了未來編排方法巨大的未開發空間。例如,在 GAIA 套件上,當前最佳路由方法僅達到約60%的準確率,而完美委託理論上可達85%以上。
研究團隊已公開發布該基準平臺、標註層、參考干預套件、分析流水線以及220個按條件執行的存檔。這些資源託管在 GitHub 上,供研究人員復現實驗並在此基礎上探索新的委託與編排策略。DecisionBench 的提出為多智慧體系統研究提供了一個標準化、可復現的評估框架,有望推動該領域的快速發展。