走进一家连锁咖啡馆,盯着菜单上的贝果三明治插画,会突然生出一种说不清的不适感——面包完美对称,芝士光泽剔透,比真实食物更"像"食物,却又哪里不对。这不是你的错觉。过去几个月,这类AI生成菜单在社交媒体上被反复截图群嘲,从会自己吃尾巴的虾到圆得像台球的冰淇淋球,网友把它们叫作"洛夫克拉夫特式食物恐怖"。

这背后不是简单的画面翻车,而是生成式AI一个更结构性的毛病正在餐饮这个低门槛场景里第一次变得肉眼可见:模型在收敛,输出越来越像同一张脸。

贝果的诡异感,是"收敛"不是"崩溃"

Reality Defender的CTO Alex Lisle把这种现象比作"外星人试图理解披萨的核心原理"——看起来像那么回事,细节全是错的。他给出的技术解释很直接:大量生成菜单的提示词最终都指向同一批快餐连锁的视觉语言,"很多东西看起来像2015年的Chili's菜单,这是有原因的,那正是模型训练时抓取的语料"。

Lisle特意做了一个区分:这不是学界警告过的"模型崩溃"(model collapse,即模型反复吃自己生成的内容后彻底退化,他形容为"疯牛病"式的自我污染),而是程度更轻的"收敛"——输出质量没有垮掉,只是越来越同质。这个区分不是凭感觉下的,已有研究给出了机制支撑:递归训练会让模型逐渐丢失原始数据里那些稀有、非典型的特征,方差不断收窄;另一项针对生成循环的研究也发现,即便起始提示词足够多样,反复迭代后依然会收敛到少数几个通用视觉母题。

菜单同质化是怎么被喂出来的 连锁快餐 菜单语料 模型训练 统计收敛 生成菜单图 圆润讨喜 网络 扩散 被再 采集 训练 每一轮生成图混入下一轮训练集,稀有特征逐渐被磨平

人比模型更爱挑"好看"的图

但把锅全甩给训练数据,是这件事里最容易被忽略的一半真相。即便某个模型没有吃进任何AI生成内容,餐厅老板和设计师在几十张候选图里挑的,大概率也是那张最光滑、最"讨喜"的——这是一种独立于技术故障的人为选择压力,会在没有递归训练的情况下,把同质化再放大一层。

Elon University学者Lee Rainie的说法印证了这个判断:"这些数据集的优化目标是讨喜、不冒犯,而这种优化最终会变成同质化。AI在图像和语言上做的事,都是把棱角削平。"换句话说,同质化不只是模型学坏了,也是使用者集体偏好在筛选阶段做的加法。

  • 结论.菜单雷同的根源有两条,一条是模型侧的统计收敛,一条是人挑图时的审美偏好,后者往往被忽视,却同样在起作用。

三款主流工具,表现并不一样

如果同质化纯粹是模型天生的极限,那不管用什么工具都该一样难看。但现实不是这样。

工具风格辨识度文字/排版能力商用留痴
Midjourney风格最鲜明,但商用需Pro/Mega订阅菜单文字排版偏弱需订阅方享有生成内容所有权
ChatGPT Images 2.0指令遵循较强密集文字生成、复杂排版最优无内置留痴机制
Adobe Firefly创意度相对保守排版稳定自动附加内容凭证,便于留证

这张对比说明一件事:菜单"千篇一律"很大程度上是流程问题,不是AI能力的天花板。用同一个模型、同一套提示词、同一种"挑好看"的筛选习惯,批量产出的东西自然长一个样。分工作流——用一个工具做创意、另一个工具做排版、再叠加商用留痴——是现成但几乎没人用的解法。


菜单之外,眼见为实还能信多久

问题不止于审美。Lisle提醒的是更深一层的东西:菜单用AI插画来表现"本店实际出品",本身可能构成对消费者的隐性误导。杜伊斯堡大学一项研究发现,人们对AI生成食物图片的感知热量判断和真图差不多,但会明确认定它"更不真实",食用意愿也更低——这种直觉式的排斥,正是社交媒体上"AI菜单反噁"格外猛烈的心理基础。

人们说不清哪里不对,但一眼就能认出那种"不对"。

这套逻辑不会只停在菜单上。同一批底层生图模型正在被电商详情页、房产广告、社交内容大规模复用,一旦"讨喜优化"批量生产出的图像持续回流进下一代训练集,视觉信息环境的同质化速度和范围,目前还没人能给出确切答案。对餐厅经营者来说,现实的选择很朴素:要么接受这种被识破的风险,要么老老实实拍一张真食物的照片。