Arena AI 模型 ELO 歷史
該圖表揭示了AI模型在釋出後因更新而可能出現的效能下降(“nerf”),資料來自LMSYS Arena的眾包人類評估,展示了各主要實驗室旗艦模型隨時間變化的ELO分數。
AI模型的效能並非一成不變。許多實驗室在模型釋出後仍會進行更新,有時這些更新會導致意想不到的“削弱”,例如更嚴格的審查、過度的量化以減少計算成本,或行為退化。為了揭示這些隱藏的趨勢,一個基於LMSYS Arena資料的ELO歷史圖表應運而生。
LMSYS Arena透過數千次盲測、眾包的人類評估來測試模型效能,被認為是衡量模型真實能力的最可靠指標。該圖表每天自動從Hugging Face上的官方LM Arena排行榜資料集獲取資料,確保資訊的即時性。
圖表的設計邏輯十分巧妙:每個主要AI實驗室只有一條曲線,代表其旗艦模型系列。在每一個時間點,曲線追蹤該實驗室在排行榜上評分最高的旗艦型號,而非最新發布的型號。例如,如果實驗室釋出了中端模型(如Sonnet),但高階模型(如Opus)仍然表現最佳,曲線將保持在Opus上。此外,帶有“-thinking”、“-reasoning”或“-high”等字尾的推理模式變體被視為同一底層模型的不同模式,因此被合併,避免曲線在這些變體之間來回切換。
新發布的模型會以標記點顯示,並附有標籤,通常伴隨著分數的躍升。而模型在生命週期內出現的任何下降趨勢,即退化,也在曲線中清晰可見。需要注意的是,該圖表反映的是API端點的原始模型效能,而消費者聊天介面(如gemini.com或chatgpt.com)可能會新增系統提示、安全過濾器或UI特定的封裝,導致體驗差異。此外,提供商可能在高峰期靜默切換模型的量化版本以節省計算資源,造成API基準測試無法完全捕捉的“削弱”感。
總之,這個ELO歷史圖表為AI社群提供了一個透明且動態的視角,幫助觀察者追蹤旗艦模型的實際表現變化,識別潛在的退化問題,從而做出更明智的模型選擇。
圖表每天從Hugging Face自動拉取資料,保證了資料的即時性和可靠性。LMSYS Arena的眾包評估機制基於數千次盲測,由人類評估員對模型輸出進行評分,從而得出ELO分數。這種評估方式避免了自動化基準測試可能存在的偏差,更貼近實際使用場景。
對於每個AI實驗室,圖表只追蹤其旗艦模型系列。所謂旗艦模型,是指該實驗室在排行榜上ELO分數最高的代表性模型。例如,如果OpenAI同時擁有GPT-4和GPT-4 Turbo,圖表會顯示分數較高的那個。如果實驗室釋出了一箇中級模型(如Anthropic的Sonnet),但旗艦模型(如Opus)依然表現更優,曲線不會切換。這種設計確保了曲線的穩定性和可讀性。
推理模式變體(如-thinking、-reasoning)被視為同一模型的不同模式,因此被合併。這樣做避免了曲線因模式切換而頻繁波動。新模型釋出時,圖表會用標記點標註,並附上名稱,通常伴隨著分數的躍升。而退化跡象,如分數持續下滑,也會在曲線上清晰顯示,幫助使用者識別效能下降的模型。
需要注意的是,圖表反映的是API端點的原始模型效能。消費者聊天介面(如gemini.com或chatgpt.com)可能額外新增系統提示、安全過濾器和UI特定的封裝,這些不在原始API中。此外,提供商可能在高峰期靜默切換模型的量化版本以節省計算資源,這會導致使用者在介面上感知到“削弱”,而API基準測試無法完全捕捉。因此,圖表提供的是模型的基礎效能資料,但實際使用者體驗可能因部署差異而有所不同。
總體而言,這個ELO歷史圖表為AI社群提供了一個寶貴的工具,用於跟蹤旗艦模型的效能變化,識別潛在的退化,並在選擇模型時做出更明智的決策。