大模型在文本世界吃透互联网语料后,一群英国创业者把目光投向了地球最偏远的角落。

2026 年 9 月 23 日,总部位于伦敦的 Basecamp Research 宣布完成 1.4 亿美元 C 轮融资。这笔交易由 S32 领投,英伟达、Anthropic 旗下基金以及北约创新基金跟投,直接将这家创办仅六年的公司推向约 8 亿美元 估值,累计融资额攀升至约 2.25 亿美元

支撑这份高估值的,是一个极具极客浪漫色彩的叙事:现有的公共基因数据库早已陷入枯竭,想要让 AI 真正学会造药,就得把南极深海、热带雨林和火山口的极端微生物通通测序,做成万亿级 Token 喂给自研的 EDEN 大模型。

资本愿意为这套宏大叙事买单,但生物学从来不按软件行业的算力定律出牌。

数据茧房的破局,与自证预言的隐忧

在 Basecamp 的叙事逻辑里,当前 AI 制药之所以在临床上收效甚微,根源在于生物学被关进了“数据荒漠”。

人类所掌握的文字总和不过几万亿 Token,而地球上的核苷酸序列估算高达 10 的 37 次方。面对如此广袤的生命密码,主流科研界却长期在极狭窄的泥潭里打转。Basecamp 在其 2025 年 6 月发表于 bioRxiv 的预印本论文《Breaking Through Biology's Data Wall》中列出一组扎眼的数据:公共序列读取档案(SRA)中,68% 的数据量仅来自 5 个物种,光是人类自己就占了 54%

在他们看来,拿这些被人类中心主义严重污染的数据去训生物大模型,无异于只拿 1975 年的几份报纸去教 ChatGPT 理解整个世界。

公共基因数据库物种分布 vs 真实演化多样性 公共 SRA 序列库分布 人类独占 54% 其他4种模式生物 14% 地球其余全部已知物种 32% 注:数据源自 Basecamp 自研预印本披露口径,尚未通过同行评议独立核验

于是,Basecamp 联手英伟达、Anthropic、PacBio 与 Ultima Genomics 搞起了万亿基因图谱,甚至将 EDEN 接入了 Anthropic 的 Claude Science 科研工具链。他们宣称通过在全球数十个国家实地采样,截至 2024 年已将已知蛋白质宇宙扩大了 10 倍以上

但这套逻辑里藏着一个显而易见的利益冲突:证明公共库严重缺陷、并以此佐证自身采样护城河必不可少的关键论据,恰恰来自公司自己尚未经过同行评议的预印本。

生物演化历经数十亿年筛选出的分子博弈固然精妙,但从深海热泉泥样中捞出的未分类 DNA 片段,究竟是能直接治病的黄金,还是未经生化标注的计算噪音,学术界目前并没有统一的结论。

跑分幻象与行业残酷的验证阶梯

在当下的生成式生物 AI 赛道,存在着一条界限分明却常被商业公关故意模糊的“验证鄙视链”。

从计算机模拟跑分,到体外试管合成,再到活体动物甚至人体临床,每往前迈一步,淘汰率都是指数级上升。

生成式生物 AI 的四级验证断层 第一级:计算基准 In Silico 结构跑分 代表:Isomorphic IsoDDE 超越 AF3 第二级:体外活性 Wet-Lab 物理合成 代表:Evolutionary 仅验证发光蛋白 第三级:活体动物 小鼠感染与组织反应 当前:Basecamp 小鼠抗感染与活细胞 第四级:人体临床 毒性、代谢与成药性 代表:Generate GB-0895 进入三期 多数 AI 生物平台卡在第二级,Basecamp 刚触及第三级边缘,离成药仍隔着临床深渊

DeepMind 孵化的 Isomorphic Labs 至今主要拿 IsoDDE 引擎在结构预测和亲和力跑分上展示肌肉,其公开证据依然停留在纯粹的算法层面;Meta 科学家离职创办的 EvolutionaryScale 轰动一时的 esmGFP 发光蛋白,本质上也只是在实验室器皿里证明了生成的结构具备生物荧光反应,离疾病治疗八竿子打不着。

目前唯一在生成式蛋白领域拿到硬核临床凭证的,是 Generate:Biomedicines 针对重症哮喘的抗体药物 GB-0895,该管线已挺进临床三期试验。然而其针对的 TSLP 靶点本身机制早已成熟,且在研发全流程中,传统湿实验抗体工程究竟贡献了几成,AI 又独立发挥了多大作用,外人根本无法量化剥离。

算法在虚拟世界里的完美折叠,往往会在真实的血液微环境中被撞得粉碎。

Basecamp 拿出的所谓证据,是一个名为 EDEN-7 的新型抗生素在小鼠身上对抗耐药菌的表现,以及体外改造 T 细胞杀死肿瘤的初筛数据。但这恰恰暴露了致命的认知错位:计算机模型在柔性构象和复杂配体计算上存在先天盲区,分子一旦进入血液,必须经受结合效价、靶向选择性、细胞膜渗透性、代谢动力学以及器官蓄积毒性等多维物理考验。

更何况,小鼠不会说话,小鼠体内行得通的分子,在进入人体试验后因严重免疫排斥或肝肾毒性被直接枪毙的案例,在现代制药史上俯拾皆是。


物理硬壁垒,不是堆算力就能融化的

比筛选抗生素更激进的,是 Basecamp 这次押注的核心技术路线:体内细胞疗法(In-vivo cell therapies)。

传统的 CAR-T 细胞治疗需要把患者的免疫细胞抽出来,在无菌工厂里通过病毒载体完成基因改造,再耗资数十万美元回输体内。Basecamp 的野心是利用大模型设计出源自噬菌体的大型丝氨酸重组酶,直接在人体活体内完成精确的基因片段插入。

愿景极其诱人,但在生物物理学家眼里,这无异于在悬崖边走钢丝。

  • 风险.大模型可以轻易在屏幕上生成出活性极高的重组酶序列,但无法替患者解决系统递送载体(Vector)在体内的靶向脱靶毒性与免疫风暴。

古人讲“道在迩而求诸远,事在易而求诸难”。Basecamp 跑遍天涯海角去测序极端物种,试图从细菌对抗病毒的原始战争中寻找分子剪刀,但这把剪刀进入结构高度复杂的人体细胞核后,会不会引发非目标区域的错配突变?外源设计的非人类蛋白会不会被免疫系统当成入侵异物直接摧毁?

这些阻碍药物转化的物理硬约束,根本不是单纯靠增加几个千亿级 DNA Token 就能靠 Scaling Law 自动“涌现”解决的。

撕掉极客面具,向传统制药补课

任何纯计算平台的估值泡沫,最终都要在临床淘汰赛前见底。

Basecamp 这轮融资中最值得玩味的细节,不是融了多少钱,而是人事任命:S32 普通合伙人、前谷歌健康业务 Verily 首席执行官 Andy Conrad 正式加入董事会;同时,曾长期在跨国药企 Biogen 执掌商业化的老将 Richard Pearce 加盟出任首席业务官。

这两个职位的变动释放了一个冷峻信号:靠自然探索与算力图谱讲故事的极客阶段已经结束,Basecamp 必须按照传统 Biotech 的规矩去过临床申报(IND)的独木桥。

在资本退出的倒计时面前,如果自研管线无法推进到人体一期试验拿到真实的安全性数据,再庞大的万亿基因图谱,最终也不过是一座躺在云服务器里的高成本标本馆。

  • 结论.将大模型直接等同于新药研发,是技术乐观主义对生物学复杂性的系统性轻慢;算力只能缩短寻找分子的时间,决定一款药能否救命的,永远是人类肉身最朴素的生理法则。