AI實驗室是否在“鵜鶘最大化”?
Dylan Castillo進行了一項嚴謹的研究,測試了7個AI模型在繪製不同動物騎乘各種交通工具方面的表現,旨在驗證AI實驗室是否針對Simon Willison的非正式基準(鵜鶘騎自行車)特意訓練了模型。結果顯示,沒有證據表明存在所謂的“鵜鶘最大化”(pelicanmaxxing)現象。
Dylan Castillo近日發佈了一項深入研究,探討了一個備受關注的問題:AI實驗室是否在針對Simon Willison的一個非正式基準刻意訓練模型,使其擅長繪製“鵜鶘騎自行車”的場景?Willison此前曾用這一古怪的提示詞測試模型,並懷疑實驗室可能在訓練數據中加入了類似樣本。為了徹底驗證這一猜測,Castillo設計了一套系統化的實驗方案。
Castillo選取了8種不同的動物——包括鵜鶘、火烈鳥、蒼鷺等,以及6種交通工具——自行車、獨輪車、滑板車、飛機、船和摩托車,共組成48種不同的提示組合。每個提示在7個主流的AI圖像生成模型上重複生成3次,這些模型包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。為了評估生成結果的質量,Castillo還藉助了GPT-5.6 Luna和Gemini 3.1 Flash-Lite進行輔助評判。整個實驗共生成1008張圖像,數據量相當可觀。
為了便於直觀地分析結果,Castillo搭建了一個帶有篩選功能的網格視圖,用户可以通過該工具查看每個模型在所有動物-交通工具組合上的表現。經過逐項對比和分析,實驗數據明確否定了“鵜鶘最大化”的假説。具體而言,研究得出了以下關鍵證據:第一,鵜鶘騎自行車的圖像質量並不比其他動物騎自行車時更好;第二,各個實驗室在繪製鵜鶘這一動物時,整體水平沒有顯著差異;第三,繪製自行車的能力同樣沒有體現出明顯優勢;第四,即便考慮到不同組合的難度差異,鵜鶘騎自行車的組合也沒有表現出異常突出的表現;第五,鵜鶘騎自行車的場景看起來並非模型記憶中固定模板的簡單復現。
Castillo在總結中強調:“鵜鶘畫得並不比其他動物好。自行車畫得也不比其他交通工具好。沒有一個實驗室在組合上的表現超出其單獨畫鵜鶘和單獨畫自行車時各自表現的預期。在這之中,GLM-5.2是最接近‘鵜鶘最大化’的,它在鵜鶘-自行車這個單元格上提升最大,而且它生成的第一張鵜鶘騎自行車樣本確實引起了我的注意。但這種效果很小且不顯著,我不建議過分看重這一結果。”
這項研究為AI模型訓練中關於“數據污染”和“過度優化特定基準”的擔憂提供了重要的實證檢驗。結果表明,至少在這個廣受關注的案例中,AI實驗室並未針對流行的非正式基準進行刻意的過度訓練。這一結論對於理解當前AI模型的行為特性、制定更科學的評測方法,以及緩解公眾對模型公正性的疑慮,都具有積極意義。