一份用真实蘑菇照片做的AI测试,最近在技术圈流传:研究团队Quesma从公开数据集里挑出1,040张野外拍摄的蘑菇照片,覆盖55个物种,让16个主流多模态大模型做0-shot识别。结果Gemini 3.6 Flash综合表现最好,首猜命中率64%,前五命中率85%,测试成本只要4.43美元,比号称"最佳视觉模型"的GPT-5.6-Sol-pro还便宜近六倍。但这份榜单最该被读到的,不是谁跑分高,而是死亡帽这种致命物种的识别率只有46%——高分和保命之间,隔着一条被整体准确率掩盖的裂缝。

46%和64%,是两个不能混着看的数字

Quesma选的55个物种不是随便凑的,一份是波兰官方可售蘑菇名单,一份是维基百科的致命蘑菇名单,两份名单交叠出一个尴尬的品种——Tricholoma equestre,在有些国家算美味,在另一些国家却有致命记录。这提示了一个前提:蘑菇鉴定天生是个高度不对称的任务,可食种和剧毒种在形态上可能几乎一样,而毒素不会因为下锅而分解。

在这个前提下,64%的整体首猜命中率其实没什么参考价值。死亡帽(Amanita phalloides)的首猜正确率只有46%,17%的情况被认成了可食用的灰鹅膏。另一个致命物种在原文里被反复提到:致命丝膜菌27%的概率被误认成鸡油菌——一种在中欧、东欧森林里最常被采食的野生菌。这不是随机噪音,而是系统性混淆:模型总是把陌生的致命种,认成最熟悉的可食种。

致命物种的两种命运 死亡帽 · 正确识别 46% 死亡帽 · 误认为可食灰鹅膏 17% 致命丝膜菌 · 正确识别 16% 致命丝膜菌 · 误认为可食鸡油菌 27% 数据来源:Quesma蘑菇识别基准测试(1,040张照片)
  • 风险.整体准确率越高的榜单,越容易让读者忽略"致命种被认成可食种"这一类子错误,而这类错误恰恰是唯一会致命的一种。

便宜模型反而更靠谱,贵的没赢

榜单里还有一个反直觉的商业信号:花更多钱不代表认得更准。

模型首猜准确率前五命中率测试成本
Gemini 3.6 Flash64%85%$4.43
GLM-5.3-flash47%72%$0.24
Claude Opus 544%63%$8.00
GPT-5.6-Sol-pro39%62%$26.18
qwen3.8-27b13%24%$15.73

Claude Opus 5GPT-5.6-Sol-pro都是各家厂商力推的旗舰视觉模型,前者收费是Gemini 3.6 Flash的近两倍,后者是六倍,但两者的首猜准确率都没能追上便宜的Gemini和GLM系列。这说明frontier模型的"更贵更强"叙事,在这类细分识别任务上并不成立——通用视觉能力强,不代表垂直领域的物种细分能力强。对于打算把AI识图接进产品的团队,这是个值得记住的教训:选型时该测的是具体场景表现,不是模型的整体名气。


数据集口径和现实代价,都比原文讲得含糊

原文引用的FungiTastic数据集,说是34万条观测、61.5万张照片、2,800个物种。但这份数据集的项目文档目前显示的规模更接近35万条观测、超过65万张照片、约5,000个细粒度类别——版本或统计口径存在差异,原文没有说明用的是哪个版本,这类基准测试引用数据集时,规模描述本身就该核对清楚。更关键的是,这批数据里只有约2,000条观测有DNA测序确认,专家标注和DNA确认并不是同一件事,前者靠经验判断,后者才是最硬的证据。

比起数据口径,更该被拿出来称重的是现实代价。美国CDC记录显示,2025年11月到2026年3月,加州出现39例疑似鹅膏毒素中毒,4人死亡,3人接受了肝移植。北美真菌学协会为此专门维护了一套志愿者鉴定网络,美国中毒控制中心的免费热线可以24小时接听,建议是"别等症状出现才求助,别自己催吐"。这套应急体系是给真人专家用的,现在AI聊天窗口正在成为很多人第一步咨询的对象,而这份基准测试从头到尾只测了"认得准不准",完全没有涉及模型会不会说"可以吃"这种结论性的话,也没测过模型该在什么置信度下主动拒答、转介专家。

认得准和用得安全,是两件事。
  • 提醒.如果你也习惯拍照问AI"这是什么菇",记住46%和17%这两个数字——它们比64%更该被你记住。

对普通采菌人来说,这份榜单能给的实际建议很朴素:可以用AI做初筛,缩小范围,但遇到伞菌、鹅膏属这类容易和致命种混淆的类型,别把AI的第一个答案当成最终答案。下一步真正该有的,不是继续刷高整体准确率,而是有人愿意专门去测"致命种被误判为可食种"的比例——这个数字目前没人公开报告过。