跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

解讀當今開源與閉源模型的效能差距

文章摘要

開源模型與閉源模型之間的效能差距並非單一數字所能概括,而是涉及基準測試的演變、實際應用表現以及訓練正規化的轉變。文章分析了這一動態變化,指出基準測試的可信度下降,以及前沿實驗室為維持收入而不斷自我革新的經濟壓力。同時,中國實驗室的開源模型在基準測試上表現出色,但在魯棒性和實際應用中仍有差距。

來源Interconnects (Nathan Lambert)作者: Nathan Lambert
解讀當今開源與閉源模型的效能差距
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

當前,開源模型似乎永遠在追趕閉源模型的路上,但這種差距被簡化為一個單一數字——比如人工分析智慧指數(Artificial Analysis Intelligence Index)——掩蓋了模型能力覆蓋範圍的複雜且關鍵動態。該指數由約10個子評估組成,旨在捕捉語言模型能力的“前沿”。然而,我花了大量時間研究這種動態如何被誤解,因為人們傾向於將效能和趨勢簡化為一個數字。

基準測試本身也在演變。隨著時間推移,它們與實際使用表現的相關性時高時低。不同的模型在真實世界中的表現與其基準排名之間的關係並不總是對應的。此外,訓練方法也在變化,進一步影響了基準測試的適用性。例如,Gemini 3的基準分數驚人,但在當前AI工具測試和部署的重點領域——代理任務——中卻顯得無足輕重,這暴露了測量方法的固有缺陷。

這種動態的核心是行業不斷變化。大約每12到18個月,基準測試的關注點就會轉移一次。不同的關注領域對應著截然不同的訓練域,特別是在後訓練階段。一個正規化持續得越久,行業就越擅長測量其效能。然而,在快速後訓練改進的新時代,我對基準測試的信心反而降到了相對最低點。

自ChatGPT問世以來,焦點從聊天、數學和簡單程式碼,轉變為更復雜的編碼和代理任務。如今,強化學習與可驗證獎勵(RLVR)成為主導訓練方法,但應用領域已從簡單的問答檢查擴充套件到複雜環境。前沿實驗室投入巨資掌握當前焦點——如程式碼和終端任務——同時開始涉足更專業的知識工作,如會計、法律和醫療保健。這些新任務仍然是代理性質的,但需要更多專業知識和與現有軟體的整合。

評估這些複雜語言模型工作流本身就是一個具有挑戰性的研究問題。任務越來越難,所需資料也越來越私密(相對於GitHub上大量的程式碼)。領先的開源模型實驗室受益於資料行業的經濟動態,類似於建造晶片工廠:美國少數前沿實驗室支付天文數字購買新環境和資料集,而快速跟隨的實驗室(通常在中國)後來以大幅折扣購買。這關鍵的一點常被忽略:非前沿實驗室追趕的槓桿隨時間不斷變化。認為蒸餾是中國模型進步的關鍵槓桿,忽略了對當前訓練正規化中強化學習環境重要性的認識。如果能夠構建出與人工分析智慧指數中單項評估相似的環境,中國實驗室就能保持追趕。

值得思考的問題是:當前任務集的緊迫性——即編碼和終端任務——對於維持前沿實驗室的收入增長有多關鍵?如果代理編碼能力飽和,AI效能的“前沿”轉移到別處,那麼大量企業收入可能更多依賴於客戶關係、慣性和更好的產品開發,而非模型本身的絕對優勢。這種不穩定的位置迫使前沿實驗室不斷自我革新,以證明大規模AI基礎設施建設的價值。我仍然傾向於認為這一建設是值得的,Anthropic和OpenAI將成為利潤極高的企業,但這需要他們持續解鎖有吸引力、有價值的新用例,同時開源模型逼近的基準並非完整訊號。

我推定中國領先的開源模型比美國前沿實驗室更注重基準測試,因為他們有動機展示出緊追最先進閉源模型的形象。但說中國實驗室只靠過度擬合基準來維持敘事是極其天真的。他們的模型確實強大,而過度推銷與真正創新的平衡很微妙。在分佈外的基準如WeirdML或ARC AGI 2上,開源模型遠遠落後;但在無數隨機基準上,它們又出人意料地強。實際使用中,你能感受到魯棒性的缺失(例如長上下文能力不足,需要比Claude/Codex更頻繁地重置代理上下文),但它們並非根本不同類別的模型,比許多人預期的要接近得多。開源模型能追趕多久?這仍是一個開放問題。

展開要點與分析

文章情報

工程師進階

要點

  • 開源與閉源模型的差距是動態且多維的,不能簡單用一個數字衡量。
  • 基準測試不斷演變,其與實際使用表現的相關性正在減弱。
  • 中國開源模型在基準測試上緊追美國前沿模型,但在魯棒性和代理任務上仍有不足。
  • 前沿實驗室需要不斷開拓新領域以維持其競爭優勢和收入增長。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。