AI News HubLIVE
站内改写2 分钟阅读

Arena AI 模型 ELO 历史

该图表揭示了AI模型在发布后因更新而可能出现的性能下降(“nerf”),数据来自LMSYS Arena的众包人类评估,展示了各主要实验室旗舰模型随时间变化的ELO分数。

来源Hacker News AI作者: mayerwin

AI模型的性能并非一成不变。许多实验室在模型发布后仍会进行更新,有时这些更新会导致意想不到的“削弱”,例如更严格的审查、过度的量化以减少计算成本,或行为退化。为了揭示这些隐藏的趋势,一个基于LMSYS Arena数据的ELO历史图表应运而生。

LMSYS Arena通过数千次盲测、众包的人类评估来测试模型性能,被认为是衡量模型真实能力的最可靠指标。该图表每天自动从Hugging Face上的官方LM Arena排行榜数据集获取数据,确保信息的实时性。

图表的设计逻辑十分巧妙:每个主要AI实验室只有一条曲线,代表其旗舰模型系列。在每一个时间点,曲线追踪该实验室在排行榜上评分最高的旗舰型号,而非最新发布的型号。例如,如果实验室发布了中端模型(如Sonnet),但高端模型(如Opus)仍然表现最佳,曲线将保持在Opus上。此外,带有“-thinking”、“-reasoning”或“-high”等后缀的推理模式变体被视为同一底层模型的不同模式,因此被合并,避免曲线在这些变体之间来回切换。

新发布的模型会以标记点显示,并附有标签,通常伴随着分数的跃升。而模型在生命周期内出现的任何下降趋势,即退化,也在曲线中清晰可见。需要注意的是,该图表反映的是API端点的原始模型性能,而消费者聊天界面(如gemini.com或chatgpt.com)可能会添加系统提示、安全过滤器或UI特定的封装,导致体验差异。此外,提供商可能在高峰期静默切换模型的量化版本以节省计算资源,造成API基准测试无法完全捕捉的“削弱”感。

总之,这个ELO历史图表为AI社区提供了一个透明且动态的视角,帮助观察者追踪旗舰模型的实际表现变化,识别潜在的退化问题,从而做出更明智的模型选择。

图表每天从Hugging Face自动拉取数据,保证了数据的实时性和可靠性。LMSYS Arena的众包评估机制基于数千次盲测,由人类评估员对模型输出进行评分,从而得出ELO分数。这种评估方式避免了自动化基准测试可能存在的偏差,更贴近实际使用场景。

对于每个AI实验室,图表只追踪其旗舰模型系列。所谓旗舰模型,是指该实验室在排行榜上ELO分数最高的代表性模型。例如,如果OpenAI同时拥有GPT-4和GPT-4 Turbo,图表会显示分数较高的那个。如果实验室发布了一个中级模型(如Anthropic的Sonnet),但旗舰模型(如Opus)依然表现更优,曲线不会切换。这种设计确保了曲线的稳定性和可读性。

推理模式变体(如-thinking、-reasoning)被视为同一模型的不同模式,因此被合并。这样做避免了曲线因模式切换而频繁波动。新模型发布时,图表会用标记点标注,并附上名称,通常伴随着分数的跃升。而退化迹象,如分数持续下滑,也会在曲线上清晰显示,帮助用户识别性能下降的模型。

需要注意的是,图表反映的是API端点的原始模型性能。消费者聊天界面(如gemini.com或chatgpt.com)可能额外添加系统提示、安全过滤器和UI特定的封装,这些不在原始API中。此外,提供商可能在高峰期静默切换模型的量化版本以节省计算资源,这会导致用户在界面上感知到“削弱”,而API基准测试无法完全捕捉。因此,图表提供的是模型的基础性能数据,但实际用户体验可能因部署差异而有所不同。

总体而言,这个ELO历史图表为AI社区提供了一个宝贵的工具,用于跟踪旗舰模型的性能变化,识别潜在的退化,并在选择模型时做出更明智的决策。