AI進步真實嗎?四個獨立指標證實了它
本文通過四個獨立指標(METR的時間跨度、TrackingAI的離線認知測試、人類最後考試、ARC-AGI-2)證明AI能力在2025年底出現了顯著跳躍,並分析了背後的四種機制:預訓練效率提升、基於可驗證獎勵的強化學習、工程化工具鏈以及自我增強的飛輪效應。同時指出了數據牆、可靠性差距和ARC-AGI-3等潛在挑戰。
近年來,關於AI進步是否真實的爭論從未停歇。許多基準測試很快就被“飽和”,讓人懷疑模型是否只是學會了應試技巧。然而,通過分析四個獨立且長期持續的衡量指標,我們發現了一個明確且一致的信號:AI的能力在2025年底出現了質的飛躍。
首先,METR(衡量AI完成軟件工程任務的時間跨度)顯示,2024年3月Claude 3 Opus只能完成4分鐘的任務,而到2026年2月,Claude Opus 4.6已能處理超過12小時的複雜工程任務。其次,TrackingAI的離線認知測試由於不公開,有效避免了訓練數據污染。該測試通過IQ分數換算成“擊敗AI所需的人類數量”,2024年3月超過90%的人類優於AI,但到2026年6月,只有1/44的人類能超越AI。第三,人類最後考試(HLE)涉及博士級多學科問題,從2025年5月的2.7%正確率躍升至2026年6月的53%,背後的計算量增加了200倍。第四,ARC-AGI-2測試流體推理而非知識記憶,在長達15個月的停滯(GPT-4o和GPT-5均為9%左右)後,2025年11月Gemini 3 Pro達到31%,Claude Opus 4.5達到38%,GPT-5.2在12月達到53%。
這些指標獨立測量了不同類型的智能——任務執行、流體推理、認知水平和專家知識——卻在同一時間窗口(2025年第四季度)同時拐點向上,構成了AI領域的“曲棍球棒曲線”。
背後的驅動力來自四個相互促進的機制。第一,預訓練效率提升:Epoch AI估算,達到同等能力所需的計算量每8個月減半,混合專家模型(如DeepSeek V3)大幅降低了浪費。第二,基於可驗證獎勵的強化學習:通過程序生成的數學和代碼問題提供無限訓練數據,DeepSeek R1在2025年1月展示了這種方法的威力。第三,工程化工具鏈(Harness Engineering):無需修改模型本身,僅改進系統提示、工具調用和驗證循環就能顯著提升效果,例如LangChain團隊將固定模型GPT-5.2-Codex在Terminal Bench上的得分從52%提升到66%。第四,自我改進飛輪:Anthropic報告稱,到2026年5月,其超過80%的合併代碼由Claude生成,AI在開放性工程任務中的成功率從26%飆升至76%。
但進步並非沒有阻礙。數據牆:高質量人類文本預計在6年內耗盡,合成數據和強化學習是替代方案但尚未完全解決。可靠性差距:METR的80%成功率時間跨度遠低於50%的指標,模型“有時成功”與“可靠成功”之間仍有鴻溝。ARC-AGI-3:2026年3月發佈的新測試要求交互式推理,所有前沿模型得分目前低於1%。
綜上所述,AI進步是真實的,並已通過多個獨立指標和可解釋的機制得到確認。然而,未來的路既可能繼續加速,也可能遇到平台期。正如作者所言,這將是令人着迷的觀察之旅。