“Generate an SVG of a frog with a Habsburg jaw.”

这句提示词很短,要求却不低:生成一只青蛙,给它画上“哈布斯堡下巴”,最后还得交付可解析、可渲染的 SVG。现有材料称,14 个模型共产生 42 份输出,全部生成了合法 SVG。

数字看起来漂亮。问题也恰好藏在“成功”两个字里。

目前能够确认的成功,更接近“模型交出了格式正确的文件”。至于青蛙像不像青蛙、下颌是否真的体现了哈布斯堡家族肖像中常见的突出特征,现有材料没有提供完整的视觉评分。

42 次成功,成功的是文件格式

SVG 是一种基于 XML 的矢量图格式。模型不能只描述画面,还要写出路径、形状、颜色、图层和坐标。漏一个闭合标签,浏览器就可能无法正常渲染。

因此,这道题确实同时碰了几个能力点:

  • 能否按要求输出 SVG,而不是 PNG 或文字说明;
  • 能否生成语法合法、可以渲染的代码;
  • 能否把“青蛙”和“突出的下颌”组合进同一幅画;
  • 能否理解“哈布斯堡下巴”这个历史与外貌特征混合的概念。

但现有结果只充分覆盖了前两项。后两项需要人看图,或者至少需要一套公开的视觉评分规则。

评测层级可以检查什么现有材料能否支持
文件合法性XML 是否可解析、SVG 是否能渲染可以,42 份输出被报告为合法 SVG
指令遵循是否确实画了青蛙,是否直接输出 SVG未提供逐张判定
概念理解是否表现出突出的下颌,而非随意加宽嘴部缺少评分标准
视觉质量构图、辨识度、细节和审美缺少人工评分
稳定性同一模型多次运行是否保持质量缺少逐次结果与方差分析

这也是原标题容易造成误解的地方。“42 次全部成功”听起来像 42 张图都画对了。更严谨的说法是:现有材料称,42 次均生成了合法 SVG;视觉任务是否完成,目前无法据此确认。

项目还有几块关键信息没有出现在所给材料中:14 个模型的完整名称与版本、采样参数、运行环境、SVG 验证方法、42 份原始输出,以及逐张视觉合格率。源码和可长期访问的存档链接也未提供。

缺了这些,读者无法复跑,也无法判断不同模型是否接受了完全相同的条件。本文因此不做模型排名。

这道怪题有价值,但价值不在排名

“哈布斯堡下巴”不是一个普通绘图词。它来自欧洲哈布斯堡家族成员在历史肖像中反复出现的突出下颌特征。把它安到青蛙身上,模型需要完成一次跨概念组合:先理解历史标签,再把人体特征转译成动物造型。

这种题比“画一只可爱的青蛙”更能制造区分度。常规提示词容易被训练数据中的高频图像覆盖;怪题则会逼模型现场组织概念。

我认可这种个人测试的灵感。很多实用评测,本来就来自一个具体而古怪的需求。程序员会让模型修一段真实项目里的旧代码,设计师会用自家品牌规范测试出图,研究者也常拿边缘案例寻找模型短板。

但个人测试和公开基准之间,隔着一整套度量方法。

“无规矩,不成方圆。”早期工业建立统一度量衡,不是因为尺子比工匠更聪明,而是因为不同人的结果终于可以比较。AI 基准也是同一个道理:固定输入、固定版本、保存原始输出、明确评分规则,最好再让不同评审交叉打分。

这项青蛙测试目前更像“氛围测试”:

个人压力测试可复现基准
题目有趣,能快速发现异常题目、参数和版本全部固定
允许依靠个人观感判断评分标准提前公开
适合探索模型能力边界适合比较模型和支持采购
结果可启发后续实验结果可复核、可复跑

两者都有效,但用途不同。拿个人压力测试寻找问题,很聪明;拿它证明某个模型全面领先,就走远了。

还有一个反方意见需要承认:视觉评分本身也会带来主观性。有人认为突出嘴部就算“哈布斯堡下巴”,有人会要求下颌轮廓更接近历史肖像。解决办法不是放弃评分,而是把标准写出来,并公开每张图,让读者知道分数是怎么来的。

真正需要这类测试的人,该怎么用

最受影响的是两类人:要选择模型的开发团队,以及把生成式 AI 接进设计流程的人。

开发团队如果只关心“模型能否稳定返回可渲染 SVG”,这项测试有一定参考价值。但采购或迁移工具链之前,还要检查路径复杂度、渲染兼容性、文本元素、文件体积,以及失败后能否自动修复。一个浏览器能打开的 SVG,未必适合进入生产系统。

设计团队更不能只看合法率。模型可能交出结构正确的代码,却把青蛙画成蜥蜴,或者只给嘴角添一条线。格式通过,返工成本照样落在人身上。

更实际的测试办法,是从自己的工作里抽取十几道任务,同时记录四类结果:

  • 文件能否打开;
  • 是否遵守关键约束;
  • 人工修改需要多久;
  • 同一提示词重复生成时,质量是否稳定。

接下来如果要把这只青蛙升级成真正的基准,最该补的也很具体:公开 42 份 SVG,列出模型与版本,保存完整参数,再给每张图标注“格式有效、青蛙可辨识、下颌特征成立、整体可用”四项结果。

到那时,14 个模型之间的差距才可能浮出来。现在的 42 次成功只能说明一件事:模型越来越会按格式交作业了。

至于作业有没有答对,还得看那只青蛙的下巴。