人类基因组约30亿个碱基对里,只有2%负责编码蛋白质,剩下98%长期是一片灰色地带。9月8日,Google DeepMind上线了AlphaGenome Atlas——一个预先算好人类基因组中全部90亿种可能的单核苷酸变异效应的数据库,数据总量达到1PB,并配了一个叫AVI(AlphaGenome Variant Impact)的综合评分,方便研究者不用逐条翻数据就能挑出最值得跟进的变异。
这套系统听起来像基因组学版的AlphaFold:把一次性的高昂计算成本挪到DeepMind自己身上,换来全球研究者免费复用的检索层。但撑起这次发布的两个标杆案例——罕见病和复杂性状——细看之下都有值得多问一句的地方。评分本身也没有公开计算细节,这在一个主打“零代码、人人可用”的工具上,是个不小的隐患。
Atlas不是新模型,是把AlphaGenome“跑死”变成数据库
Atlas的底层还是DeepMind今年早些时候放出的AlphaGenome模型:一个约4.5亿参数、能吃进最长1Mb DNA序列的卷积-Transformer架构,早前已经证明了非编码区的单个碱基改变能怎样扰乱蛋白质生产之类的分子过程。
Atlas做的事是把这个模型对基因组上每一个位点、每一种可能的碱基替换全跑一遍——大约30亿参考位点乘以每个位点3种替换方式,等于90亿次预测,每条预测还要覆盖数百种人类和小鼠细胞/组织类型。据独立报道,DeepMind为了把这件事算完,最初需要大约80倍的速度提升,靠模型蒸馏、GPU内核优化和消除冗余计算才啃下来。
AVI分数则是把这套非编码区调控预测,和另一个模型AlphaMissense对编码区蛋白质影响的预测捏在一起,生成一个单一数字。方便是真方便,问题也在这——DeepMind没有公开AVI的数值范围、两个模型间的权重、跨组织的聚合方式,也没给出“高风险”的判定阈值。换句话说,研究者拿到的是一个结论,却看不到过程。
DNM1案例和“22%更多关联”,都有场景错配的问题
官方给出的两个亮点案例是这样的:Broad Institute的研究者用AVI分数在一起罕见病疑难病例中,锁定了DNM1基因上一个可能造成错误splice site的变异,为病例提供了关键辅助证据;另一位研究者把Atlas用在UK Biobank超过5.4万名参与者的数据上,按预测的分子效应给变异分组后,多找到22%的非编码区遗传关联,并锁定19个和BMI相关的基因区域。
这两个故事听起来都很漂亮,放在一起看却有点拧。DNM1相关的严重发育性癫痫脑病,通常是罕见的新生变异(de novo variant)驱动的——也就是父母身上没有、孩子身上新出现的突变。UK Biobank这个队列,本身是由存活到中老年、相对健康的志愿者组成,天然带有“幸存者偏差”,主要反映的是常见变异,并不适合用来验证这类严重早发疾病的机制。用它来给DNM1案例“背书”,逻辑上是两条不太搭的线。
“22%更多关联”这个数字也值得多想一步。它更可能是某种基准测试下的相对富集提升——比如某个统计方法找到的关联数量比另一种方法多22%——而不是“多确诊了22%的致病变异”。原文的叙述方式很容易让人把两者混为一谈。
一个不透明的评分,正在试图统一编码区和非编码区、罕见病和常见性状的解读
- 提醒.独立学者更想看到的是绝对数量而非比例,以及在FinnGen、All of Us、TOPMed等独立队列里能否复现,目前这些验证还没有出现。
谁该认真对待它,谁该先等一等
罕见病遗传学研究者会是Atlas最直接的受益人群——面对成千上万个候选变异,一个能快速排序的工具确实省事,前提是不把AVI分数当成唯一证据,DeepMind自己也在发布材料里承认,高分不等于致病性证据,这只是计算机模拟预测,不是实验测量。
复杂性状和GWAS方向的研究者则要多一分耐心,19个BMI相关区域是不是真的经得住独立队列复现,现在还不知道。
临床遗传咨询和诊断机构则该明确划线:Atlas目前只开放学术和非学术用途,商业版Google Cloud接入尚未上线,DeepMind也写明了不可用于临床诊断——这条边界一旦被基因检测公司提前跨过,风险不在DeepMind身上,而在使用者身上。
- 风险.AVI评分与SpliceAI、CADD、Enformer等既有工具相比的真实优势尚无严格基准测试公开,评分越方便,越容易被过度信任。
接下来最值得盯的,不是DeepMind下一次公关稿里还会讲什么新案例,而是完整的AVI技术论文什么时候公开,以及DNM1和BMI这两个案例能不能在独立队列里站得住。地图画得再大,终究要靠别人重新走一遍才算数。
