AI News HubLIVE
站内改写2 分钟阅读

与鸡蛋玩“AI传话”:第10轮弄丢了“chicken”,最后变成“鹌鹑”

一位研究者用同一个描述模型和两个图像生成器,对鸡蛋图片做了25轮“图像描述→生成→再描述”的传话实验。Nano Banana 2链在第10轮丢掉了“chicken”,但图像直到约12轮后才变成野鸟蛋;GPT Image 2链则一直稳定。作者认为,浅灰色背景等相对用词和首轮渲染的小偏差是漂移的根源。

来源Hacker News AI作者: goxion

一位网名为GENO的研究者发布了一项有趣的AI实验:用“图像描述→生成新图→再描述”的方式,让AI玩25轮“传话”。他固定使用同一个描述模型,并让两条链并行:一条用OpenAI的GPT Image 2,另一条用Google的Nano Banana 2。每轮只把描述文本传给生成器,图片本身不会传递给下一轮;第一轮生成的图直接作为下一轮描述对象,不重roll。

在Nano Banana 2这条链上,前9轮生成的鸡蛋都被描述为“chicken egg”(鸡蛋),但第10轮“chicken”突然消失,只剩下“egg”。奇怪的是,图像在接下来约12轮里看起来仍然是普通鸡蛋,直到描述开始变成“像海鸦或大型斑点物种”,图片才真正演变成一颗像自然历史博物馆展品的野鸟蛋。也就是说,文字先丢失,像素后跟上。相比之下,GPT Image 2链的25轮描述一直保留“chicken”,最终图像也仍是超市里常见的鸡蛋。

为什么两条链差异这么大?GENO认为关键在描述中的用词。GPT Image 2链把蛋壳上的斑点称为“气孔”(pore),这是蛋壳本身的一部分;而且背景描述在第3轮意外写下了“255亮度”这个绝对数字,白色已经没有继续漂白的空间。Nano Banana 2链则把斑点称为“blotches”“splatter”(斑点、溅洒),这些词暗示东西“在蛋壳表面”。大约第11轮后,描述变成“滴状”“重力滴落颜料行为”,第23轮甚至出现“哑光蛋壳+光泽斑点”的诡异组合,好像一只蛋上有两种材质,尽管没有任何人写过“油漆”这个词。

背景的漂移更早埋下伏笔。Nano Banana 2链第一轮生成的图片,背景恰好是“浅灰色”而不是纯白,于是之后的描述一直沿用“light gray”。相对词“灰”总能继续变灰:第4轮出现轻微暗角,第6轮变成径向渐变,到第21轮已经是“径向光晕”和“博物馆灯光”。此时氛围字段开始写“观察中的标本”,鸡蛋也就不得不变成那种灯光下会出现的物种。GENO指出,这个源头只是第一轮生成的一次渲染意外,而控制实验(第一轮强制纯白背景)还没有跑。

他还记录了蛋壳纹理的演变:微孔→孔隙→点蚀→凸起色素→多孔,约十轮内完成。点蚀意味着小洞,在另一次超过25轮的运行中,第27—28轮蛋壳上真的出现了裂纹,随后模型又把蛋“修”回完整。裂纹并非随机,描述已经在为“受损表面”积累词汇。

实验还纠正了GENO最初的假设:起始提示词里有“from top”(俯视),但两条链都生成了竖立站着的蛋。这不是描述模型的锅,而是两个生成器在第一步都选择了统计上最常见的解读——俯视时阴影环绕在蛋周围,正面看时阴影在蛋下方,二者其实是同一个椭圆,但一旦选择了正面视角,俯视视角就再也不会回来。

最后,作者补充说,由于自己数错了轮数,Nano Banana 2链在某一轮(他记为第29轮)的提示词变成了“a quail egg”(鹌鹑蛋)。标题里的“a quail”就是这么来的。作者把50张图片和全部轮次的JSON记录公开,并坦言自己只有两条链,没法回答“是否AI传话总是在文字先失败”这个问题。正如他所说:“两条链不是一个数据集。”