Dylan Castillo把“鹈鹕骑自行车”这个流传已久的生成式AI趣味测试,做成了一次带对照的交叉实验。他组合了8种动物和6类交通工具,得到48组提示词,再让7款模型各运行3次。按这一设计计算,共有1008次生成运行。

Castillo的原始实验没有发现显著证据,证明受测模型被刻意强化了“鹈鹕骑自行车”的能力。Simon Willison随后转述并评论了这项研究,但实验设计、执行和结论来自Castillo。它真正说明的问题也很明确:一张生成得格外漂亮的图片,可以用来发现问题,不能单独用来证明模型记住了样本、训练数据受到污染,或厂商专门“刷题”。

七款模型交叉测试,GLM-5.2只有轻微异常

Castillo测试的模型包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro。每组提示词重复运行3次,避免把一次随机采样当成稳定能力。

实验的关键不在图片数量,而在对照方式。Castillo没有只比较七张“鹈鹕骑车”图片,而是把动物、交通工具和两者组合拆开检验。

检验对象对照方式本次结果
鹈鹕与其余7种动物比较没有表现出稳定优势
自行车与其余5类交通工具比较没有表现出稳定优势
鹈鹕与自行车的组合与模型原有的动物、交通工具能力比较没有出现超出基础能力可解释范围的显著增益
场景是否被记忆检查构图和细节是否像直接复现未呈现明显的记忆复制特征

这个拆分很重要。假如某款模型本来就擅长画鸟,也擅长处理自行车结构,那么它画好“鹈鹕骑自行车”并不奇怪。只有这一组合显著超过两项基础能力所能预测的水平,专项训练或数据污染的怀疑才会更有分量。

GLM-5.2最接近异常。它在这一特定组合上的提升幅度最大,第一张样图也引起了研究者注意。但该效应较小,未达到显著水平,不能据此推断训练污染或厂商操纵。

评分环节还借助了GPT-5.6 Luna和Gemini 3.1 Flash-Lite。这提高了处理大量图片的效率,也给结论留下了一层边界:自动评审模型可能共享相似的审美偏好,不能完全替代独立人工判断。

流行提示词适合快速排查,不足以支撑“刷题”指控

“鹈鹕骑自行车”这类提示词有实际价值。开发者可以用它快速观察模型能否处理动物身体、车轮结构、骑行动作和空间关系,成本远低于搭建完整评测集。它更像一次冒烟测试:能暴露明显故障,却不能独立完成模型审计。

单点测试最容易混淆三种情况:

  • 模型的通用生成能力确实变强;
  • 某次随机采样碰巧产出了一张好图;
  • 模型见过相似内容,甚至针对公开题目做过优化。

只看最终图片,这三种解释往往难以区分。公开基准也长期面临相似问题:测试题一旦在网络上广泛传播,就可能进入后续训练语料。此时,高分究竟来自能力提升还是题目泄漏,需要依靠未公开样本、重复实验和对照组来判断。孤证不立,图像生成评测同样如此。

Castillo的实验比单张样图可靠,因为它同时比较了其他动物、其他交通工具和其他组合。但它还不是全面审计。每个单元只有3次采样,难以捕捉较小而不稳定的差异;部分评分由模型完成,也可能漏掉人类评审能够识别的结构错误。

结论还只能覆盖这7款受测模型及其对应版本。模型接口、系统提示词和生成管线一旦更新,结果就可能变化。“本次未发现证据”不能外推成“所有AI实验室从未针对公开测试训练”。

技术选型不能再由一张演示图拍板

负责模型评测的开发者,最现实的动作是把流行提示词扩展成任务矩阵。更换主体、动作和场景,多次采样,并记录模型版本、调用参数和测试时间。自动评分可以承担初筛,进入采购或上线决策前,仍应安排盲评或交叉复核。

产品负责人面对的风险更直接。一张漂亮样图很容易在采购会上占据注意力,但它无法回答稳定性、业务适配度和失败率。预算决策应回到团队自己的任务集,而不是厂商演示或社交平台上的爆款结果。

相关角色不应据此采取的动作更稳妥的做法
模型评测与选型团队用一个流行提示词给模型排总榜建立多主体、多场景对照,并重复采样
产品与预算负责人根据一张最佳样图追加预算或更换模型用真实业务素材试跑,复核常见失败案例
技术负责人把自动评分直接当作最终验收保留人工盲评,并检查不同评审是否一致

三次重复足以让明显异常更难藏在偶然性里,却承担不了全面审计。接下来真正该看的变量,是同一优势能否在未公开提示词、更多采样和独立人工评分中持续出现。若不能复现,再漂亮的鹈鹕也只是一张样图。