AI在计算机屏幕里跑赢人类已经不再让人惊讶,但如果把它扔进真实的生化实验室,让它在试管里凭空造物,它还能交出及格卷吗?
2026年9月19日,前沿研究机构Edison Scientific与FutureHouse正式抛出了一份名为「生物学千禧年难题」(The Millennium Problems for Biology)的倡议草案。这份清单打破了此前业内流传的5项简版传闻,一口气列出了首批12项难题,并公开向全球科学界征集红队测试与技术修正。表面上看,它在效仿数学界著名的千禧年猜想;但剥离掉那层向克雷数学研究所致敬的仪式感,这套题目骨子里其实是一份为AI量身定制的物理抗作弊考卷。
从文本刷榜走向物理试管的极限压测
长久以来,生物大模型最擅长的事情其实是写论文、猜结构和在虚拟基准里打榜。FutureHouse此前主导的LAB-Bench和LABBench2,测试的无非是文献检索、序列推断和实验排错。这类纯数字基准很快就陷入了数据污染和对齐游戏的泥潭,模型分数越刷越高,却无法证明自己拥有独立驱动实体科学发现的能力。
这一次,发起方定下了极其苛刻的五大顶层遴选标准:必须具备根本性的科学或工程难度、结果客观易验、支持在数天至数周内快速完成湿实验、对生物技术具备颠覆效应,以及最关键的,杜绝模型耍小聪明。他们试图以此构建AI在生命科学领域的终极评估基准。
试题的交付要求明确到了近乎刻板的地步。例如在逆转录翻译酶这一题中,官方要求开发出一种纯化催化剂,在没有任何核酸模板或数据库比对的前提下,直接读取一段任意多肽并将其逆向合成为对应的核酸链。验收指标必须经受严格的盲测:对至少100条长度不低于50个氨基酸的预注册随机多肽,实现90%以上的测序准确率,平均读长不低于25个残基,质量分数达到Q10。
这不再是生成一段看起来像模像样的生化论文摘要,而是逼着AI把方案拿到离心机和质谱仪上去对质。
撕开演化铁律与可行性断层
通读这12道考题,会发现它们并不仅仅是对现有工业生物技术的渐进改良,而是密集地向自然演化了数十亿年的热力学与分子生物学底座发起冲击。
在光合作用的关键限速步骤上,名单要求设计出的Rubisco酶,其二氧化碳相对氧气的特异性(Sc/o)必须达到微藻Galdieria partita的水平,催化周转数(kcat)则必须赶上玉米Rubisco。在天然演化序列中,特异性与催化速度从来都是不可兼得的权衡取舍,而这项挑战直接要求模型打破已知的帕累托前沿。
更激进的题目甚至试图重写生命硬件:构建完全由四联密码子驱动的活细胞、人工合成整套3'到5'方向行进的聚合酶,以及在无生命前体中重现具有遗传特性的原生细胞。
淮南子有言:“循理而动,不为物先。”生命演化的铁律从不是凭空捏造的代码逻辑。
从已有的可行性评估来看,这12道难题呈现出极端的两极分化。
改良Rubisco或在24小时内零样本设计定向切割蛋白酶,尚且属于计算生物学与合成生物学的理性延展;但要求成年野生型小鼠在完整玻璃化冷冻至少24小时后成活率超过99%且无永久器官损伤,或是无模板单锅指数级扩增任意多肽,在当前的物理化学认识下,几乎属于科幻构想。
工程师还原论遭遇生命的混沌现实
这份清单引发的真正分歧,不在于题目够不够难,而在于它折射出的范式冲突。
计算机工程师习惯了定义清晰的输入与输出,倾向于把生命拆解成可量化的模块。为了满足快速评测的要求,发起方刻意将验证周期限定在数天至数周之内。这一硬性约束,直接导致了严重的学科倾斜:整张考卷几乎被分子生物学和合成生物学完全垄断。
那些高度依赖长期动态观察的复杂系统——发育过程中的表观遗传调控、肿瘤微环境的免疫逃逸、神经系统的网络突触,乃至宏观的生态种群涨落——因为无法被塞进几天内见分晓的试管读数里,被统统排除在外。
更现实的博弈在于标准的严密性与安全性边界。若不严格限定全功能衣壳的纯度比率,让细菌表达病毒载体的任务很容易沦为廉价的质粒制备;而一旦AI真的掌握了在24小时内精准合成特定靶向蛋白酶的能力,这类平台技术可能大幅降低高风险生物制剂的合成门槛,直接踩中双重用途(Dual-use)的监管雷区。
- 结论.这套考卷的真正价值不在于短期内催生灵丹妙药,而在于它终于把AI生物学的裁判权,从虚高的大模型排行榜夺回到了物理现实手中。
- 风险.用追求速战速决的工程通关思维度量生命科学,容易将复杂的生命系统削足适履,最终变成另一种自欺欺人的指标竞赛。
把千禧年难题的名号借给生物学,是一次极具野心的智力挑衅。但试管不是显卡,自然界花费数十亿年筑起的物理屏障,也不会因为模型参数量翻倍就自动让路。AI能不能从一个合格的科研助理蜕变为真正的创造者,答案不在硅片上,而在每一次解冻、离心与反应淬灭的真实物理结果里。
