AI News HubLIVE
站內改寫2 分鐘閱讀

與雞蛋玩“AI傳話”:第10輪弄丟了“chicken”,最後變成“鵪鶉”

一位研究者用同一個描述模型和兩個影像生成器,對雞蛋圖片做了25輪“影像描述→生成→再描述”的傳話實驗。Nano Banana 2鏈在第10輪丟掉了“chicken”,但影像直到約12輪後才變成野鳥蛋;GPT Image 2鏈則一直穩定。作者認為,淺灰色背景等相對用詞和首輪渲染的小偏差是漂移的根源。

來源Hacker News AI作者: goxion

一位網名為GENO的研究者釋出了一項有趣的AI實驗:用“影像描述→生成新圖→再描述”的方式,讓AI玩25輪“傳話”。他固定使用同一個描述模型,並讓兩條鏈並行:一條用OpenAI的GPT Image 2,另一條用Google的Nano Banana 2。每輪只把描述文本傳給生成器,圖片本身不會傳遞給下一輪;第一輪生成的圖直接作為下一輪描述物件,不重roll。

在Nano Banana 2這條鏈上,前9輪生成的雞蛋都被描述為“chicken egg”(雞蛋),但第10輪“chicken”突然消失,只剩下“egg”。奇怪的是,影像在接下來約12輪裡看起來仍然是普通雞蛋,直到描述開始變成“像海鴉或大型斑點物種”,圖片才真正演變成一顆像自然歷史博物館展品的野鳥蛋。也就是說,文字先丟失,畫素後跟上。相比之下,GPT Image 2鏈的25輪描述一直保留“chicken”,最終影像也仍是超市裡常見的雞蛋。

為什麼兩條鏈差異這麼大?GENO認為關鍵在描述中的用詞。GPT Image 2鏈把蛋殼上的斑點稱為“氣孔”(pore),這是蛋殼本身的一部分;而且背景描述在第3輪意外寫下了“255亮度”這個絕對數字,白色已經沒有繼續漂白的空間。Nano Banana 2鏈則把斑點稱為“blotches”“splatter”(斑點、濺灑),這些詞暗示東西“在蛋殼表面”。大約第11輪後,描述變成“滴狀”“重力滴落顏料行為”,第23輪甚至出現“啞光蛋殼+光澤斑點”的詭異組合,好像一隻蛋上有兩種材質,儘管沒有任何人寫過“油漆”這個詞。

背景的漂移更早埋下伏筆。Nano Banana 2鏈第一輪生成的圖片,背景恰好是“淺灰色”而不是純白,於是之後的描述一直沿用“light gray”。相對詞“灰”總能繼續變灰:第4輪出現輕微暗角,第6輪變成徑向漸變,到第21輪已經是“徑向光暈”和“博物館燈光”。此時氛圍欄位開始寫“觀察中的標本”,雞蛋也就不得不變成那種燈光下會出現的物種。GENO指出,這個源頭只是第一輪生成的一次渲染意外,而控制實驗(第一輪強制純白背景)還沒有跑。

他還記錄了蛋殼紋理的演變:微孔→孔隙→點蝕→凸起色素→多孔,約十輪內完成。點蝕意味著小洞,在另一次超過25輪的執行中,第27—28輪蛋殼上真的出現了裂紋,隨後模型又把蛋“修”回完整。裂紋並非隨機,描述已經在為“受損表面”積累詞彙。

實驗還糾正了GENO最初的假設:起始提示詞裡有“from top”(俯視),但兩條鏈都生成了豎立站著的蛋。這不是描述模型的鍋,而是兩個生成器在第一步都選擇了統計上最常見的解讀——俯視時陰影環繞在蛋周圍,正面看時陰影在蛋下方,二者其實是同一個橢圓,但一旦選擇了正面視角,俯視視角就再也不會回來。

最後,作者補充說,由於自己數錯了輪數,Nano Banana 2鏈在某一輪(他記為第29輪)的提示詞變成了“a quail egg”(鵪鶉蛋)。標題裡的“a quail”就是這麼來的。作者把50張圖片和全部輪次的JSON記錄公開,並坦言自己只有兩條鏈,沒法回答“是否AI傳話總是在文字先失敗”這個問題。正如他所說:“兩條鏈不是一個資料集。”