用GPT-5.6、Claude、Gemini和Grok“绘制”蒙娜丽莎
一个AI绘画竞技场让四个前沿模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash)使用彩色铅笔工具重现名画和根据提示绘画。GPT-5.6 Sol在质量上领先,而Grok 4.5表现不佳。Claude Fable 5的成本是其他模型的20倍,但并非最佳。实验表明模型经常达到平台期并过度修正。
一项新颖的AI绘画实验将四个前沿模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash)置于同一个“绘画竞技场”中。每个模型都获得了一张空白画布和一套彩色铅笔工具——包括设定颜色、笔尖宽度、压力、绘制笔画、涂抹、擦除等操作——并需要重现名画(蒙娜丽莎和梵高的星夜)或根据文本提示自由创作。模型可以随时查看自己的作品和目标图像,并调整策略。整个实验共产生了28幅画作。
结果差异显著。GPT-5.6 Sol在几乎所有画作中都表现最佳,尤其是星夜和玫瑰,其细节丰富且色彩协调,无论从主观质量还是客观评分看都是明显赢家。它的成本也最低(约7.74美元),使用了最少量的工具调用。相比之下,Claude Fable 5的成本高达160美元(其他模型的20倍),耗时最长(平均每幅超过12.5分钟),但画作质量并不比Sol更好。Grok 4.5表现最差,画作基本不可用,尽管它使用了最多的工具调用和最高的token量(3400万),但凭借缓存和低价策略,成本仅9.21美元。Gemini 3.6 Flash在结构相似度(SSIM)评分上获得了最高分(蒙娜丽莎峰值0.449,星夜0.190),但画作的外观并不最接近目标,且它经常过度编辑,导致最终评分低于峰值。
工具使用模式也揭示了各模型的行为差异。GPT-5.6 Sol和Gemini 3.6 Flash将颜色和笔刷设定直接嵌入绘制调用中,因此工具调用次数较少。而Grok 4.5则频繁调用单独的设定工具(占总调用的65%),说明它在规划上更混乱。Claude Fable 5倾向于大量使用涂抹功能(123次)和频繁查看画布。Gemini是自我审查最频繁的模型,每幅画平均查看画布23次。尽管如此,频繁的审查并未带来更高的最终评分——所有模型都在早期达到平台期,然后随着持续编辑而评分下降。例如,Gemini的蒙娜丽莎在峰值0.449后最终降至0.337。
作者认为,这项实验并非严格的基准测试,而是揭示“前沿模型”与开源模型之间的差距。GPT-5.6 Sol在绘画任务上展示了显著能力,而开源模型在此类任务上几乎不可用。Claude Fable 5尽管在其他任务中表现优异,但这里性价比最低。Grok 4.5则尚未能可靠理解或判断视觉输出。Gemini 3.6 Flash虽比Grok好,但作为快速模型,与真正的前沿版本相比仍有差距。作者邀请读者在TryAI平台上自行尝试这些模型。