一个专注开源模型报道的团队,这次没有再写一篇模型解读,而是上线了两个工具:Artifacts HubAdoption Dashboard。前者收录了过去两年发布的792个模型,后者按地理和机构画出下载量与衍生模型数量,重点标出美中差距。听起来像是又一个模型排行榜,但真正有意思的地方在别处——这把量出"谁在赢"的尺子,是这个团队自己造的。

发生了什么

Artifacts Hub把四家数据源缝在了一起:Hugging Face的趋势和下载数据、Open Router的推理token用量、Artificial Analysis的智能指数,再加上团队自研的"相对采用度指标"(RAM)。他们还和AI验证初创公司Project VAIL合作,加了一项模型相似度指数,用来看新模型和上一代模型到底像不像。

Adoption Dashboard更轻,但来头更早——它把此前那份聚焦美中开源模型采用差距的The ATOM Project报告,变成了一个每日更新的看板。团队说,这份报告发布后他们经常被问起那张美中对比图,索性做成实时数据。

Artifacts Hub 的数据拼图 下载/趋势 Hugging Face 推理token Open Router 智能指数 Artificial Analysis 相似度指数 Project VAIL 汇总为 RAM 采用度评分

792这个数字说明什么,又不说明什么

四家数据源里,前三家都是行业里已经被广泛引用的第三方基础设施,唯独VAIL是刚认识的新伙伴,团队自己形容它是"最忠实的粉丝之一"。这句话透出的信号很直白:这套体系目前主要靠圈内互相背书撑着,还没有走出这个圈子。

下载量这个指标本身就有老问题。Hugging Face的下载数字统计的是文件被请求的次数,不是唯一用户数,更不是真实的生产环境部署量——脚本重复拉取、缓存刷新都会往里灌水。RAM想做的,是把这类噪声按时间和模型体量做归一化,听起来合理,但具体怎么处理重复下载、怎么设权重,目前公开信息里没有讲清楚。

一个排行榜一旦被行业当真,就会被行业倒过来优化。这是所有量化榜单绕不开的宿命——古德哈特定律说过,一旦某个指标变成目标,它就不再是好指标。开源模型发布方如果发现RAM和曝光度挂钩,刷榜的动力自然会出现。


一把新尺子,还没人验过

翻遍能找到的公开讨论,目前没有看到任何独立于Interconnects、artifactshub.ai、atomproject.ai这几个自家域名之外的第三方评测、社区反馈或方法论质疑。这不是说工具没用,而是说它还处在自证阶段——数据链条完整,但检验链条是空的。

尺子是自己造的,刻度也是自己定的。

这句话不是否定,而是提醒:一份数据看起来越权威、越像"官方基准",越需要问一句它是怎么算出来的。Artifacts Hub现在扮演的角色,更像是把私下流传的行业共识第一次可视化,而不是一份经过同行评议的统计报告。

现在能确认的三件事 792 近两年精选模型数 4家 数据/评分来源方 0 已知的第三方独立评测
  • 风险.如果发布方发现RAM或相似度指数直接影响曝光,刷榜和数据操纵的动力会很快出现,而目前看不到防刷机制的说明。

美中差距,还是老故事的新皮肤

Adoption Dashboard最抓眼的部分是美中开源模型采用差距,但这个框架不是新造的,它直接继承自此前那份ATOM Project报告。这次公告里没有给出任何新的具体数字,想知道差距到底有多大、是在扩大还是收窄,得自己去看板上查。

叙事本身没问题——开源模型的中美格局确实是这两年最值得盯的变量之一。但一个框架被反复引用久了,容易变成默认答案:大家习惯了"美中差距"这个说法,却很少回头问一句,这份差距是怎么测出来的,统计口径有没有变过。报纸办得久了,读者信的常常不是新闻本身,而是这份报纸的口气——这是媒体史上老掉牙的教训,放在数据工具上同样适用。

结论:这套工具真正的价值,不在于它今天量出了什么名次,而在于它能不能在未来接受同行的挑刺、公开方法论、经受住刷榜测试。开源模型发布方、研究者和投资人如果要引用这套数据讲故事,至少该先问一句RAM是怎么算的——工具是好工具,但权威性还得靠外部检验一点点挣出来。