一個有用的人工智能模型不僅要給出合理的答案,還要準確遵循指令。這聽起來簡單,實則不然。用户可能要求三句話的摘要、以隨意語氣重寫、或者答案必須包含某個詞並避免另一個詞——往往同時提出多項要求。模型可能理解主題,卻仍然會出錯。
我們的IFBench基準測試被NeurIPS 2025收錄,用於測試語言模型如何精確遵循自然語言指令。去年,獨立AI基準測試組織Artificial Analysis將IFBench納入其智能指數,該指數綜合多項評估得出模型的整體能力評分。
“我們發現,模型遵循用户指令的能力是開發者非常關心的,因此我們想明確評估這一點,”Artificial Analysis的技術人員Declan Jackson表示,“IFBench正是為填補這一空白而設計的,即使對前沿模型也頗具挑戰。”
衡量對提示的依從性
IFBench不僅僅測試基本的指令遵循——它迫使模型在單個回覆中遵守多條規則。有些規則很簡單,比如最低字數或必須包含的關鍵詞;有些則更棘手:句子長度必須匹配、連續單詞的首字母不能相同、或者關鍵詞必須出現在確切位置。
“這與其他許多基準測試不同,後者的指令遵循能力僅通過輸出模板或要求的答案結構間接體現,”Jackson説。
每條約束看似隨意,但合起來反映了常見場景:用户經常一次性要求模型完成多項任務,遺漏任何一項都可能毀掉答案。為了使IFBench貼近實際應用,其提示來自真實用户對話——而非研究人員憑空編寫。
“IFBench以更接近真實使用的方式衡量指令遵循,”Jackson説,“提示使用隨意的用户語言,涵蓋廣泛的語氣和長度,而非遵循固定模板,並聚焦於常見任務,如事實問答、內容審核與摘要、以及創意支持。IFBench更廣的覆蓋範圍使其成為指令遵循能力的更強整體指標。”
IFBench揭示其他基準遺漏的方面
AI基準測試通常壽命短暫。一旦模型開始接近滿分,這些評估就無法再區分系統差異。據Jackson稱,Artificial Analysis智能指數中的大多數評估在約六個月內就飽和了。
但IFBench尚未飽和。
“雖然IFBench分數隨時間提升,但這種進步在模型間並不均勻,新的前沿模型在它上面仍然表現不佳,”Jackson説。
這有兩個原因。
首先,複雜指令遵循與大多數實驗室積極訓練的能力之間重疊不多,Jackson説。編程和工具使用獲得大量後訓練投入,因為這方面的提升通常能泛化到其他任務和基準。指令遵循更為狹窄,很少因這些領域進展而作為副產品得到改善。
其次,IFBench衡量的廣度之大。其廣泛的約束和提示集意味着進展相對較慢,而實驗室可以通過有針對性的後訓練方案逐步攻克更專一的領域或能力評估。
這體現在數字上。Jackson説,IFBench分數按模型系列嚴格聚類,排名順序與Artificial Analysis更廣泛的智能指數並不一致。
xAI仍在IFBench上領先,Grok 4.20(0309,推理)以82.9%位居榜首,Grok 4.3緊隨其後為81.3%。最近的谷歌模型也表現良好:Gemini 3 Flash Preview(推理)達到78.0%,而Gemini 3.1 Flash-Lite Preview和Gemini 3.1 Pro Preview分別為77.2%和77.1%。OpenAI的GPT-5.5(xhigh)和GPT-5.4(xhigh)分別為75.9%和73.9%。領先的Claude模型在IFBench上得分較低,Claude Opus 4.7、Claude Sonnet 4.6和Claude 4.5 Haiku在54.3%至58.6%之間——儘管Claude Opus 4.7在智能指數中排名靠前,得分為57,僅次於GPT-5.5(xhigh)的60分,並與Gemini 3.1 Pro Preview和GPT-5.4(xhigh)並列57分。
真正開放的評估方法
IFBench對Artificial Analysis有用有兩個原因:它衡量的內容,以及我們公開發布它的事實。
開放性使Jackson的團隊能夠忠實地實施評估,並在廣泛模型上運行,從而提供用户依賴的排行榜。它還使基準測試本身更容易理解,因為任何人都可以看到衡量了什麼以及為什麼。
對於Artificial Analysis,IFBench測試了幾乎每次AI交互都會出現的問題:模型能否跟蹤用户的請求,尤其是當請求包含許多要求時。它現已成為Artificial Analysis評估的常規部分,也是Ai2開放基準為領域帶來價值的有力例證。
“除了評估,Ai2在開源方面也是重要領導者,”Jackson説,“他們的工作不僅通過開放研究推動行業進步,還為用户提供了在數據和方法的透明度下訪問研究工件的機會。”
訂閲每月獲取Ai2最新新聞。