AI进步真实吗?四个独立指标证实了它
本文通过四个独立指标(METR的时间跨度、TrackingAI的离线认知测试、人类最后考试、ARC-AGI-2)证明AI能力在2025年底出现了显著跳跃,并分析了背后的四种机制:预训练效率提升、基于可验证奖励的强化学习、工程化工具链以及自我增强的飞轮效应。同时指出了数据墙、可靠性差距和ARC-AGI-3等潜在挑战。
近年来,关于AI进步是否真实的争论从未停歇。许多基准测试很快就被“饱和”,让人怀疑模型是否只是学会了应试技巧。然而,通过分析四个独立且长期持续的衡量指标,我们发现了一个明确且一致的信号:AI的能力在2025年底出现了质的飞跃。
首先,METR(衡量AI完成软件工程任务的时间跨度)显示,2024年3月Claude 3 Opus只能完成4分钟的任务,而到2026年2月,Claude Opus 4.6已能处理超过12小时的复杂工程任务。其次,TrackingAI的离线认知测试由于不公开,有效避免了训练数据污染。该测试通过IQ分数换算成“击败AI所需的人类数量”,2024年3月超过90%的人类优于AI,但到2026年6月,只有1/44的人类能超越AI。第三,人类最后考试(HLE)涉及博士级多学科问题,从2025年5月的2.7%正确率跃升至2026年6月的53%,背后的计算量增加了200倍。第四,ARC-AGI-2测试流体推理而非知识记忆,在长达15个月的停滞(GPT-4o和GPT-5均为9%左右)后,2025年11月Gemini 3 Pro达到31%,Claude Opus 4.5达到38%,GPT-5.2在12月达到53%。
这些指标独立测量了不同类型的智能——任务执行、流体推理、认知水平和专家知识——却在同一时间窗口(2025年第四季度)同时拐点向上,构成了AI领域的“曲棍球棒曲线”。
背后的驱动力来自四个相互促进的机制。第一,预训练效率提升:Epoch AI估算,达到同等能力所需的计算量每8个月减半,混合专家模型(如DeepSeek V3)大幅降低了浪费。第二,基于可验证奖励的强化学习:通过程序生成的数学和代码问题提供无限训练数据,DeepSeek R1在2025年1月展示了这种方法的威力。第三,工程化工具链(Harness Engineering):无需修改模型本身,仅改进系统提示、工具调用和验证循环就能显著提升效果,例如LangChain团队将固定模型GPT-5.2-Codex在Terminal Bench上的得分从52%提升到66%。第四,自我改进飞轮:Anthropic报告称,到2026年5月,其超过80%的合并代码由Claude生成,AI在开放性工程任务中的成功率从26%飙升至76%。
但进步并非没有阻碍。数据墙:高质量人类文本预计在6年内耗尽,合成数据和强化学习是替代方案但尚未完全解决。可靠性差距:METR的80%成功率时间跨度远低于50%的指标,模型“有时成功”与“可靠成功”之间仍有鸿沟。ARC-AGI-3:2026年3月发布的新测试要求交互式推理,所有前沿模型得分目前低于1%。
综上所述,AI进步是真实的,并已通过多个独立指标和可解释的机制得到确认。然而,未来的路既可能继续加速,也可能遇到平台期。正如作者所言,这将是令人着迷的观察之旅。