當前,開源模型似乎永遠在追趕閉源模型的路上,但這種差距被簡化為一個單一數字——比如人工分析智能指數(Artificial Analysis Intelligence Index)——掩蓋了模型能力覆蓋範圍的複雜且關鍵動態。該指數由約10個子評估組成,旨在捕捉語言模型能力的“前沿”。然而,我花了大量時間研究這種動態如何被誤解,因為人們傾向於將性能和趨勢簡化為一個數字。
基準測試本身也在演變。隨着時間推移,它們與實際使用表現的相關性時高時低。不同的模型在真實世界中的表現與其基準排名之間的關係並不總是對應的。此外,訓練方法也在變化,進一步影響了基準測試的適用性。例如,Gemini 3的基準分數驚人,但在當前AI工具測試和部署的重點領域——代理任務——中卻顯得無足輕重,這暴露了測量方法的固有缺陷。
這種動態的核心是行業不斷變化。大約每12到18個月,基準測試的關注點就會轉移一次。不同的關注領域對應着截然不同的訓練域,特別是在後訓練階段。一個範式持續得越久,行業就越擅長測量其性能。然而,在快速後訓練改進的新時代,我對基準測試的信心反而降到了相對最低點。
自ChatGPT問世以來,焦點從聊天、數學和簡單代碼,轉變為更復雜的編碼和代理任務。如今,強化學習與可驗證獎勵(RLVR)成為主導訓練方法,但應用領域已從簡單的問答檢查擴展到複雜環境。前沿實驗室投入巨資掌握當前焦點——如代碼和終端任務——同時開始涉足更專業的知識工作,如會計、法律和醫療保健。這些新任務仍然是代理性質的,但需要更多專業知識和與現有軟件的集成。
評估這些複雜語言模型工作流本身就是一個具有挑戰性的研究問題。任務越來越難,所需數據也越來越私密(相對於GitHub上大量的代碼)。領先的開源模型實驗室受益於數據行業的經濟動態,類似於建造芯片工廠:美國少數前沿實驗室支付天文數字購買新環境和數據集,而快速跟隨的實驗室(通常在中國)後來以大幅折扣購買。這關鍵的一點常被忽略:非前沿實驗室追趕的槓桿隨時間不斷變化。認為蒸餾是中國模型進步的關鍵槓桿,忽略了對當前訓練範式中強化學習環境重要性的認識。如果能夠構建出與人工分析智能指數中單項評估相似的環境,中國實驗室就能保持追趕。
值得思考的問題是:當前任務集的緊迫性——即編碼和終端任務——對於維持前沿實驗室的收入增長有多關鍵?如果代理編碼能力飽和,AI性能的“前沿”轉移到別處,那麼大量企業收入可能更多依賴於客户關係、慣性和更好的產品開發,而非模型本身的絕對優勢。這種不穩定的位置迫使前沿實驗室不斷自我革新,以證明大規模AI基礎設施建設的價值。我仍然傾向於認為這一建設是值得的,Anthropic和OpenAI將成為利潤極高的企業,但這需要他們持續解鎖有吸引力、有價值的新用例,同時開源模型逼近的基準並非完整信號。
我推定中國領先的開源模型比美國前沿實驗室更注重基準測試,因為他們有動機展示出緊追最先進閉源模型的形象。但説中國實驗室只靠過度擬合基準來維持敍事是極其天真的。他們的模型確實強大,而過度推銷與真正創新的平衡很微妙。在分佈外的基準如WeirdML或ARC AGI 2上,開源模型遠遠落後;但在無數隨機基準上,它們又出人意料地強。實際使用中,你能感受到魯棒性的缺失(例如長上下文能力不足,需要比Claude/Codex更頻繁地重置代理上下文),但它們並非根本不同類別的模型,比許多人預期的要接近得多。開源模型能追趕多久?這仍是一個開放問題。