美国能源部(DOE)7月开出一个新网站:genesisopenmodels.anl.gov,由阿贡国家实验室托管。页面上写着,能源部联合产业伙伴Arcee AI推出首个面向科学研究的开放权重模型Genesis-Science-1,并同步开放贡献门户,接受大学、国家实验室、企业和科研非营利组织提交模型、数据与微调方案。第一轮申请窗口分两条track:基础阶段数据8月14日截止,入选后8月28日交付;后训练数据与环境类8月25日截止,9月14日交付。

这套时间表写得很具体,但具体到日期,不等于具体到模型。翻遍能源部和阿贡实验室的公开页面,找不到Genesis-Science-1的参数规模、训练语料构成、基准成绩或许可协议——目前唯一的信息来源就是这个官方门户页面本身。一个号称"首个"的科学基础模型,连最基本的模型卡都没有对外发布,这不太寻常。

门户开了,模型在哪

细读申请流程会发现一个关键细节:公开表单只收集描述和元数据,不涉及任何实际材料转移,每位贡献者自行决定材料如何处置。审核要过五道关口——科学契合度、权利与数据处置、专家与评估准备度、技术集成、最终项目选定。

这套流程更像是一次征集意向,而不是一次成熟产品的落地发布。换句话说,"Genesis-Science-1已经诞生"这句话,眼下更准确的说法或许是"Genesis-Science-1的开发框架已经搭好,正在找数据和合作方"。

  • 提醒.申请表格本身不包含任何模型能力细节,读者不该把"门户上线"等同于"模型验证完毕"。

Arcee AI是这场发布里唯一具名的产业伙伴。这家公司本身定位是模型开发与部署工具厂商,旗下Trinity系列从轻量本地模型到400亿参数级的稀疏混合专家模型Trinity Large都有覆盖。但官网没有说清楚Arcee在Genesis-Science-1里到底扮演什么角色——是从零训练,还是在已有模型基础上继续预训练,抑或只是负责微调和托管分发。这个角色差异直接决定了"能源部首个科学开放权重模型"这个说法的准确程度。

Genesis Mission本身也不是一笔到位的钱

Genesis-Science-1是能源部更大战略Genesis Mission的一部分。这项由行政令在2025年11月启动的国家级计划,目标是十年内让美国科学与工程的产出效率翻倍,串联起能源部旗下17个国家实验室、超算设施和科学数据资源,方向上承接此前业界讨论过但没有正式立法的FASST科学AI构想。

问题在于,"启动一项使命"不等于"国会拨了一笔专项预算"。能源部下属实验室多是政府所有、承包商运营的模式,可动用的资源通常来自科学办公室既有预算、实验室自主研发经费,以及企业实物贡献——不是凭空多出来的新钱。这意味着计算资源如何在国家实验室和外部研究者之间分配、企业贡献是否换来数据优先接触权,这些治理细节目前都还是空白。

历史教训:科学语气的模型最容易骗人

评价一个"科学基础模型"能不能兑现承诺,业内其实有过前车之鉴。Meta在2022年发布过专注科学文献的Galactica,公开演示后很快因为生成看似权威却完全虚构的引用和事实而被撤下——问题恰恰出在科学写作的语气天然带有权威感,读者更容易放松警惕。另一个对照是Llemma,一个基于Llama系列在Proof-Pile-2语料上继续预训练的数学专用模型,分7B和34B两个版本,训练数据和方法相对透明,属于业内公认的开放实践样本。

开放权重不是开源,参数能下载,训练过程未必能复现。

这两个先例揭示的核心问题是:"开放权重"在技术上只保证参数文件可下载,未必包含训练语料清单、去重过滤方法、训练代码、超参数或中间checkpoint。没有这些,第三方就没法真正复现模型,也没法验证厂商自报的基准分数有没有掺水或数据污染。Genesis-Science-1如果只发权重不发过程,"开放科学"这个说法就要打个问号。

2026年两个申请窗口 8月14日 基础数据截止 入选后 8/28交付 8月25日 后训练数据截止 入选后 9/14交付 此后 每3个月一轮 五道关口:科学契合 / 权利处置 / 专家评估 / 技术集成 / 最终筛选 申请表仅收集元数据,不涉及材料转移

该盯住哪几个变量

对大学、国家实验室和中小科研机构来说,真正值得关注的是审核标准是否透明,尤其是"权利与数据处置"这一关会不会让贡献方在不知情的情况下让出数据使用权。对依赖国家实验室超算的研究者来说,值得盯住的是这笔计算资源最终会不会向产业伙伴倾斜。

接下来两个可验证的节点很明确:8月14日和25日两轮申请的实际提交与入选名单,以及Genesis-Science-1是否会补上模型卡、训练语料清单和许可协议细节。如果这些东西迟迟不出现,那这次发布的分量,恐怕更接近一份意向声明,而不是一次真正的模型上线。