AI News HubLIVE
站内改写2 分钟阅读

AI实验室是否在“鹈鹕最大化”?

Dylan Castillo进行了一项严谨的研究,测试了7个AI模型在绘制不同动物骑乘各种交通工具方面的表现,旨在验证AI实验室是否针对Simon Willison的非正式基准(鹈鹕骑自行车)特意训练了模型。结果显示,没有证据表明存在所谓的“鹈鹕最大化”(pelicanmaxxing)现象。

Dylan Castillo近日发布了一项深入研究,探讨了一个备受关注的问题:AI实验室是否在针对Simon Willison的一个非正式基准刻意训练模型,使其擅长绘制“鹈鹕骑自行车”的场景?Willison此前曾用这一古怪的提示词测试模型,并怀疑实验室可能在训练数据中加入了类似样本。为了彻底验证这一猜测,Castillo设计了一套系统化的实验方案。

Castillo选取了8种不同的动物——包括鹈鹕、火烈鸟、苍鹭等,以及6种交通工具——自行车、独轮车、滑板车、飞机、船和摩托车,共组成48种不同的提示组合。每个提示在7个主流的AI图像生成模型上重复生成3次,这些模型包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。为了评估生成结果的质量,Castillo还借助了GPT-5.6 Luna和Gemini 3.1 Flash-Lite进行辅助评判。整个实验共生成1008张图像,数据量相当可观。

为了便于直观地分析结果,Castillo搭建了一个带有筛选功能的网格视图,用户可以通过该工具查看每个模型在所有动物-交通工具组合上的表现。经过逐项对比和分析,实验数据明确否定了“鹈鹕最大化”的假说。具体而言,研究得出了以下关键证据:第一,鹈鹕骑自行车的图像质量并不比其他动物骑自行车时更好;第二,各个实验室在绘制鹈鹕这一动物时,整体水平没有显著差异;第三,绘制自行车的能力同样没有体现出明显优势;第四,即便考虑到不同组合的难度差异,鹈鹕骑自行车的组合也没有表现出异常突出的表现;第五,鹈鹕骑自行车的场景看起来并非模型记忆中固定模板的简单复现。

Castillo在总结中强调:“鹈鹕画得并不比其他动物好。自行车画得也不比其他交通工具好。没有一个实验室在组合上的表现超出其单独画鹈鹕和单独画自行车时各自表现的预期。在这之中,GLM-5.2是最接近‘鹈鹕最大化’的,它在鹈鹕-自行车这个单元格上提升最大,而且它生成的第一张鹈鹕骑自行车样本确实引起了我的注意。但这种效果很小且不显著,我不建议过分看重这一结果。”

这项研究为AI模型训练中关于“数据污染”和“过度优化特定基准”的担忧提供了重要的实证检验。结果表明,至少在这个广受关注的案例中,AI实验室并未针对流行的非正式基准进行刻意的过度训练。这一结论对于理解当前AI模型的行为特性、制定更科学的评测方法,以及缓解公众对模型公正性的疑虑,都具有积极意义。

AI实验室是否在“鹈鹕最大化”? | AI News Hub