为什么AI生成的食品图片看起来总是那么恶心?
从甜甜圈虾到混凝土冰淇淋,AI生成的食品图片常常令人倒胃口。专家解释了背后的技术原因、训练数据问题以及人类心理因素。
越来越多的餐厅、咖啡馆和品牌开始使用AI生成图像来推广食物,结果是大量令人倒胃口的“AI垃圾食品图”涌现,包括甜甜圈虾、深海鲁宾三明治、虫状面条、面条状糕点以及拉丝鸡肉。
牛津大学AI、政府与政策教授、计算机视觉专家Chris Russell解释说,扩散模型从纯噪声开始逐步去噪生成图像,先恢复粗略结构,再添加细腻纹理;如果早期结构错误,模型会在错误结构上堆叠逼真纹理,导致类似“六根手指”的失败,这可能解释了甜甜圈虾等现象。
那不勒斯费德里科二世大学研究AI图像响应的行为科学家Giovanbattista Califano指出:“扩散模型在生成薄、连续、有终点的结构方面出了名地弱。面条、丝状物和卷须正是这种几何形状,会让模型出错,导致类似意大利面的伪影出现在没有解剖学或烹饪逻辑的地方。”重复纹理如气泡和种子也难以控制边界,常溢出到不该出现的位置,这解释了为什么许多AI食品图充满密集孔洞而引发密集恐惧。
苏黎世大学数字文化与艺术教授Roland Meyer表示:“AI图像生成在缺乏世界知识的情况下再现外观。”AI不知道三明治、面条或卷饼实际是什么,也不理解物理世界,只是统计上学习它们的样子。
伦敦国王学院计算机科学高级讲师Michael Cook说,AI模型不理解为何食物不应看起来像其他非食物图像,比如冰淇淋像开裂的混凝土、汉堡像岩石,“这些纹理在建筑语境中可能完全正常,但当我们将其想象为可食用的食物时就变得错误。”
专家认为,AI食品图陷入“恐怖谷”,是因为人类进化出对寄生虫、病原体等的厌恶感,当食物看起来像虫子或感染物时,会本能地抗拒。Califano说,食物领域的恐怖谷比近乎人类的形象更令人反感。
技术缺陷:扩散模型的固有限制
Califano指出,扩散模型在生成细长、连续的结构时特别困难,面条、发丝等几何形状容易导致模型不知道应在何处停止或附着,产生超出合理界限的伪影。这种失败模式解释了AI食品图中普遍存在的面条状结构、诡异图案和密集孔洞。
训练数据的偏差与“模型崩溃”
Cook提到,训练图像来源多样但缺乏透明度,“我们很少知道训练过程中内容混合比例或模型形成的关联。”食品摄影往往高度风格化,包含强烈对比、饱和色彩、光泽照明和夸张形状,有时图片中的“食物”并非真实食物。Meyer说AI模型能模仿这些表面特征和视觉惯例,但无法理解其背后的专业美学策略,这正是图片令人不安的原因。
伦敦玛丽女王大学计算创造力教授Simon Colton说,网络上普通红苹果的图片可能很少,而怪异图片在社交媒体上可能广泛传播,导致AI对食物形成奇怪的关联。此外,研究表明,用AI生成内容训练模型会导致“模型崩溃”,表现为视觉退化和图像趋同。Cook补充,许多流行的AI生成材料涉及食物,如人们跳进食物堆的视频。
提示词与图像质量的影响
生成的提示词可能模糊(如仅要求“三明治”),或包含类似“要精确”等对文本有效但对图像生成无意义的要求。低分辨率图像被放大超出预期尺寸也是问题之一:这会放大原本可能被忽略的缺陷,或留下一个模型需要填补的空白区域,而填补过程常不完美。