AI News HubLIVE
站內改寫2 分鐘閱讀

用GPT-5.6、Claude、Gemini和Grok“繪製”蒙娜麗莎

一個AI繪畫競技場讓四個前沿模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash)使用彩色鉛筆工具重現名畫和根據提示繪畫。GPT-5.6 Sol在質量上領先,而Grok 4.5表現不佳。Claude Fable 5的成本是其他模型的20倍,但並非最佳。實驗表明模型經常達到平臺期並過度修正。

來源Hacker News AI作者: hershyb_

一項新穎的AI繪畫實驗將四個前沿模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash)置於同一個“繪畫競技場”中。每個模型都獲得了一張空白畫布和一套彩色鉛筆工具——包括設定顏色、筆尖寬度、壓力、繪製筆畫、塗抹、擦除等操作——並需要重現名畫(蒙娜麗莎和梵高的星夜)或根據文本提示自由創作。模型可以隨時檢視自己的作品和目標影像,並調整策略。整個實驗共產生了28幅畫作。

結果差異顯著。GPT-5.6 Sol在幾乎所有畫作中都表現最佳,尤其是星夜和玫瑰,其細節豐富且色彩協調,無論從主觀質量還是客觀評分看都是明顯贏家。它的成本也最低(約7.74美元),使用了最少量的工具呼叫。相比之下,Claude Fable 5的成本高達160美元(其他模型的20倍),耗時最長(平均每幅超過12.5分鐘),但畫作質量並不比Sol更好。Grok 4.5表現最差,畫作基本不可用,儘管它使用了最多的工具呼叫和最高的token量(3400萬),但憑藉快取和低價策略,成本僅9.21美元。Gemini 3.6 Flash在結構相似度(SSIM)評分上獲得了最高分(蒙娜麗莎峰值0.449,星夜0.190),但畫作的外觀並不最接近目標,且它經常過度編輯,導致最終評分低於峰值。

工具使用模式也揭示了各模型的行為差異。GPT-5.6 Sol和Gemini 3.6 Flash將顏色和筆刷設定直接嵌入繪製呼叫中,因此工具呼叫次數較少。而Grok 4.5則頻繁呼叫單獨的設定工具(佔總呼叫的65%),說明它在規劃上更混亂。Claude Fable 5傾向於大量使用塗抹功能(123次)和頻繁檢視畫布。Gemini是自我審查最頻繁的模型,每幅畫平均檢視畫布23次。儘管如此,頻繁的審查並未帶來更高的最終評分——所有模型都在早期達到平臺期,然後隨著持續編輯而評分下降。例如,Gemini的蒙娜麗莎在峰值0.449後最終降至0.337。

作者認為,這項實驗並非嚴格的基準測試,而是揭示“前沿模型”與開源模型之間的差距。GPT-5.6 Sol在繪畫任務上展示了顯著能力,而開源模型在此類任務上幾乎不可用。Claude Fable 5儘管在其他任務中表現優異,但這裡價效比最低。Grok 4.5則尚未能可靠理解或判斷視覺輸出。Gemini 3.6 Flash雖比Grok好,但作為快速模型,與真正的前沿版本相比仍有差距。作者邀請讀者在TryAI平臺上自行嘗試這些模型。