越来越多的餐厅、咖啡馆和品牌开始使用AI生成食物图片来做宣传,结果网上涌现出一大批令人倒胃口的“视觉泔水”:甜甜圈虾、深海鲁本三明治、像虫子的面条、像面条的甜点、拉丝的鸡肉、像建材的冰淇淋、像大脑的冰淇淋,甚至还有说不清是什么的汉堡和引发密集恐惧的墨西哥卷饼。这些图像为什么会如此诡异?本文从技术原理、训练数据和人类心理等角度做了解释。
多位专家指出,问题往往始于图像生成原理。牛津大学人工智能、政府与政策教授、计算机视觉专家克里斯·拉塞尔说,目前很多主流图像生成模型采用“扩散”方式:从一张充满噪声(类似电视雪花)的画面开始,逐步去除噪声,最后得到目标图像。换句话说,粗略结构先被恢复,精细纹理则放在最后。如果模型在前期把基本结构搞错,后期就会把华丽的纹理堆在错误的结构上,就像一个人长了六根手指。这或许也能解释甜甜圈虾。意大利那不勒斯费德里科二世大学研究AI生成图像观感的学者乔瓦恩巴蒂斯塔·卡利法诺补充说,扩散模型尤其不擅长生成“细长、连续、带末端”的结构。面条、丝状物和卷须恰恰属于这类几何形状,因此会产生没有解剖学或烹饪逻辑的意大利面式伪影。同理,气泡、籽粒等重复纹理也难以被限制在合理边界内,容易溢出到不该出现的地方;成群的小孔还可能触发密集恐惧。
除了技术缺陷,模型本身也缺少对食物和物理世界的真正理解。苏黎世大学数字文化与艺术教授罗兰·迈耶说:“AI图像生成复制的是外观,却没有关于世界的恰当知识。”AI并不知道三明治、面条或墨西哥卷饼实际是什么,只是从统计上知道它们大多数时候长什么样。伦敦国王学院计算机科学高级讲师迈克尔·库克认为,这会导致令人不安的审美演绎:冰淇淋像开裂的混凝土,汉堡像用岩石做的。这类纹理若放在建筑施工图里也许正常,一旦被想象成食物就会立刻显得不对劲。
训练数据同样在起作用。库克指出,外界对AI模型训练过程了解极少,不知道模型接收了什么内容、建立了什么关联。迈耶则说,食物摄影往往高度风格化:锐利对比、浓烈色彩、亮泽光线、夸张外形;有时被拍摄的“食物”甚至根本不是食物。AI学会的是这些表面特征和视觉惯例,却无法复制它们背后的专业美学策略,所以会令人不安。伦敦玛丽女王大学计算创意学教授西蒙·科尔顿补充说,网上极端怪异的图片比普通红苹果更容易获得传播;模型很可能因此对食物形成奇怪联想。此外,现在不少AI模型已经在用“其他AI生成的内容”训练,这种做法可能引发“模型崩溃”,导致视觉退化,并让图像变得越来越趋同。
生成链条中的其他环节也会让情况变糟。用户写的提示以及企业给出的系统级指令未必总能得到好结果。有些提示很模糊,比如只写“做一个三明治”;有些则使用“要精确”这类适合文字任务、但对图像生成意义不大的措辞。低分辨率图片被放大到远超原始大小时,每个让人不安的瑕疵都会被放大;如果产生空洞,模型还要自行填补,而它往往填得并不完美。
人之所以会对这些图片产生强烈排斥,背后也有进化原因。科学家认为,恶心感在演化中帮助人类避开寄生虫、病原体、毒素等威胁,因此我们对“不能吃”的食物信号格外敏感。卡利法诺说,食物引发的“恐怖谷”甚至比拟人形象带来的恐怖谷更直接、更发自本能。AI生成的食物能同时触发多个危险信号:扭曲的丝状物像寄生虫或蠕虫,密集的小孔让人联想到感染与侵扰,异常的色泽和质感暗示污染或腐败。它看起来或许像食物,但大脑知道它不是,所以我们会对这盘“泔水”本能地退避三舍。