跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

為什麼AI生成的食物圖片看起來那麼不對勁?

文章摘要

餐廳和品牌用AI製作食物宣傳圖,卻不斷產出扭曲、令人反胃的“電子食品”。本文結合多位研究者解釋,這類怪象源於擴散模型的生成機制、模型對真實世界缺乏理解、訓練數據偏差以及人類演化出的厭惡反應。

來源The Verge AI作者: Robert Hart
為什麼AI生成的食物圖片看起來那麼不對勁?
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

越來越多的餐廳、咖啡館和品牌開始使用AI生成食物圖片來做宣傳,結果網上湧現出一大批令人倒胃口的“視覺泔水”:甜甜圈蝦、深海魯本三明治、像蟲子的麪條、像麪條的甜點、拉絲的雞肉、像建材的冰淇淋、像大腦的冰淇淋,甚至還有説不清是什麼的漢堡和引發密集恐懼的墨西哥捲餅。這些圖像為什麼會如此詭異?本文從技術原理、訓練數據和人類心理等角度做了解釋。

多位專家指出,問題往往始於圖像生成原理。牛津大學人工智能、政府與政策教授、計算機視覺專家克里斯·拉塞爾説,目前很多主流圖像生成模型採用“擴散”方式:從一張充滿噪聲(類似電視雪花)的畫面開始,逐步去除噪聲,最後得到目標圖像。換句話説,粗略結構先被恢復,精細紋理則放在最後。如果模型在前期把基本結構搞錯,後期就會把華麗的紋理堆在錯誤的結構上,就像一個人長了六根手指。這或許也能解釋甜甜圈蝦。意大利那不勒斯費德里科二世大學研究AI生成圖像觀感的學者喬瓦恩巴蒂斯塔·卡利法諾補充説,擴散模型尤其不擅長生成“細長、連續、帶末端”的結構。麪條、絲狀物和卷鬚恰恰屬於這類幾何形狀,因此會產生沒有解剖學或烹飪邏輯的意大利麪式偽影。同理,氣泡、籽粒等重複紋理也難以被限制在合理邊界內,容易溢出到不該出現的地方;成羣的小孔還可能觸發密集恐懼。

除了技術缺陷,模型本身也缺少對食物和物理世界的真正理解。蘇黎世大學數字文化與藝術教授羅蘭·邁耶説:“AI圖像生成複製的是外觀,卻沒有關於世界的恰當知識。”AI並不知道三明治、麪條或墨西哥捲餅實際是什麼,只是從統計上知道它們大多數時候長什麼樣。倫敦國王學院計算機科學高級講師邁克爾·庫克認為,這會導致令人不安的審美演繹:冰淇淋像開裂的混凝土,漢堡像用岩石做的。這類紋理若放在建築施工圖裏也許正常,一旦被想象成食物就會立刻顯得不對勁。

訓練數據同樣在起作用。庫克指出,外界對AI模型訓練過程瞭解極少,不知道模型接收了什麼內容、建立了什麼關聯。邁耶則説,食物攝影往往高度風格化:鋭利對比、濃烈色彩、亮澤光線、誇張外形;有時被拍攝的“食物”甚至根本不是食物。AI學會的是這些表面特徵和視覺慣例,卻無法複製它們背後的專業美學策略,所以會令人不安。倫敦瑪麗女王大學計算創意學教授西蒙·科爾頓補充説,網上極端怪異的圖片比普通紅蘋果更容易獲得傳播;模型很可能因此對食物形成奇怪聯想。此外,現在不少AI模型已經在用“其他AI生成的內容”訓練,這種做法可能引發“模型崩潰”,導致視覺退化,並讓圖像變得越來越趨同。

生成鏈條中的其他環節也會讓情況變糟。用户寫的提示以及企業給出的系統級指令未必總能得到好結果。有些提示很模糊,比如只寫“做一個三明治”;有些則使用“要精確”這類適合文字任務、但對圖像生成意義不大的措辭。低分辨率圖片被放大到遠超原始大小時,每個讓人不安的瑕疵都會被放大;如果產生空洞,模型還要自行填補,而它往往填得並不完美。

人之所以會對這些圖片產生強烈排斥,背後也有進化原因。科學家認為,噁心感在演化中幫助人類避開寄生蟲、病原體、毒素等威脅,因此我們對“不能吃”的食物信號格外敏感。卡利法諾説,食物引發的“恐怖谷”甚至比擬人形象帶來的恐怖谷更直接、更發自本能。AI生成的食物能同時觸發多個危險信號:扭曲的絲狀物像寄生蟲或蠕蟲,密集的小孔讓人聯想到感染與侵擾,異常的色澤和質感暗示污染或腐敗。它看起來或許像食物,但大腦知道它不是,所以我們會對這盤“泔水”本能地退避三舍。

展開要點與分析

文章情報

工程師進階

要點

  • 擴散模型先生成粗略結構,再補充紋理細節;結構一旦出錯,就會產生六指、甜甜圈蝦等怪象。
  • AI並不真正理解食物是什麼,只會從統計上模仿食物的外觀,因此容易產生錯誤質感和形態。
  • 食物攝影的程式化風格、網上罕見怪圖以及用AI生成內容訓練AI,都會讓圖像變得越發離奇。
  • 人類的厭惡感本用於避開病原體與寄生蟲;AI食物常常同時觸發這些原始預警信號。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。