跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

為什麼Artificial Analysis使用Ai2的IFBench指令遵循評估

文章摘要

Artificial Analysis採用Ai2開放的IFBench評估,因為它能捕捉許多基準測試忽略的指令遵循能力,在複雜多指令任務上尤其有效。該基準測試由實際使用者對話驅動,且尚未飽和,是衡量模型真實效能的重要工具。

來源Ai2 Blog
為什麼Artificial Analysis使用Ai2的IFBench指令遵循評估
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

一個有用的人工智慧模型不僅要給出合理的答案,還要準確遵循指令。這聽起來簡單,實則不然。使用者可能要求三句話的摘要、以隨意語氣重寫、或者答案必須包含某個詞並避免另一個詞——往往同時提出多項要求。模型可能理解主題,卻仍然會出錯。

我們的IFBench基準測試被NeurIPS 2025收錄,用於測試語言模型如何精確遵循自然語言指令。去年,獨立AI基準測試組織Artificial Analysis將IFBench納入其智慧指數,該指數綜合多項評估得出模型的整體能力評分。

“我們發現,模型遵循使用者指令的能力是開發者非常關心的,因此我們想明確評估這一點,”Artificial Analysis的技術人員Declan Jackson表示,“IFBench正是為填補這一空白而設計的,即使對前沿模型也頗具挑戰。”

衡量對提示的依從性

IFBench不僅僅測試基本的指令遵循——它迫使模型在單個回覆中遵守多條規則。有些規則很簡單,比如最低字數或必須包含的關鍵詞;有些則更棘手:句子長度必須匹配、連續單詞的首字母不能相同、或者關鍵詞必須出現在確切位置。

“這與其他許多基準測試不同,後者的指令遵循能力僅透過輸出模板或要求的答案結構間接體現,”Jackson說。

每條約束看似隨意,但合起來反映了常見場景:使用者經常一次性要求模型完成多項任務,遺漏任何一項都可能毀掉答案。為了使IFBench貼近實際應用,其提示來自真實使用者對話——而非研究人員憑空編寫。

“IFBench以更接近真實使用的方式衡量指令遵循,”Jackson說,“提示使用隨意的使用者語言,涵蓋廣泛的語氣和長度,而非遵循固定模板,並聚焦於常見任務,如事實問答、內容稽核與摘要、以及創意支援。IFBench更廣的覆蓋範圍使其成為指令遵循能力的更強整體指標。”

IFBench揭示其他基準遺漏的方面

AI基準測試通常壽命短暫。一旦模型開始接近滿分,這些評估就無法再區分系統差異。據Jackson稱,Artificial Analysis智慧指數中的大多數評估在約六個月內就飽和了。

但IFBench尚未飽和。

“雖然IFBench分數隨時間提升,但這種進步在模型間並不均勻,新的前沿模型在它上面仍然表現不佳,”Jackson說。

這有兩個原因。

首先,複雜指令遵循與大多數實驗室積極訓練的能力之間重疊不多,Jackson說。程式設計和工具使用獲得大量後訓練投入,因為這方面的提升通常能泛化到其他任務和基準。指令遵循更為狹窄,很少因這些領域進展而作為副產品得到改善。

其次,IFBench衡量的廣度之大。其廣泛的約束和提示集意味著進展相對較慢,而實驗室可以透過有針對性的後訓練方案逐步攻克更專一的領域或能力評估。

這體現在數字上。Jackson說,IFBench分數按模型系列嚴格聚類,排名順序與Artificial Analysis更廣泛的智慧指數並不一致。

xAI仍在IFBench上領先,Grok 4.20(0309,推理)以82.9%位居榜首,Grok 4.3緊隨其後為81.3%。最近的谷歌模型也表現良好:Gemini 3 Flash Preview(推理)達到78.0%,而Gemini 3.1 Flash-Lite Preview和Gemini 3.1 Pro Preview分別為77.2%和77.1%。OpenAI的GPT-5.5(xhigh)和GPT-5.4(xhigh)分別為75.9%和73.9%。領先的Claude模型在IFBench上得分較低,Claude Opus 4.7、Claude Sonnet 4.6和Claude 4.5 Haiku在54.3%至58.6%之間——儘管Claude Opus 4.7在智慧指數中排名靠前,得分為57,僅次於GPT-5.5(xhigh)的60分,並與Gemini 3.1 Pro Preview和GPT-5.4(xhigh)並列57分。

真正開放的評估方法

IFBench對Artificial Analysis有用有兩個原因:它衡量的內容,以及我們公開發布它的事實。

開放性使Jackson的團隊能夠忠實地實施評估,並在廣泛模型上執行,從而提供使用者依賴的排行榜。它還使基準測試本身更容易理解,因為任何人都可以看到衡量了什麼以及為什麼。

對於Artificial Analysis,IFBench測試了幾乎每次AI互動都會出現的問題:模型能否跟蹤使用者的請求,尤其是當請求包含許多要求時。它現已成為Artificial Analysis評估的常規部分,也是Ai2開放基準為領域帶來價值的有力例證。

“除了評估,Ai2在開源方面也是重要領導者,”Jackson說,“他們的工作不僅透過開放研究推動行業進步,還為使用者提供了在資料和方法的透明度下訪問研究工件的機會。”

訂閱每月獲取Ai2最新新聞。

展開要點與分析

文章情報

工程師進階

要點

  • IFBench測試模型同時遵循多條指令的能力,反映真實使用者需求。
  • 該基準基於真實對話,覆蓋多種任務,較其他指令遵循評估更貼近實際。
  • 多數基準在6個月內飽和,而IFBench仍能區分前沿模型。
  • 各模型在IFBench上的得分與其整體智慧指數排名並不一致。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。