学术界最重要的一块数字公地,刚刚完成了一次并不轻松的切割。

预印本平台 arXiv 宣布获得来自 Simons Foundation International、XTX Markets 以及 Siegel Family Endowment 联合承诺的 1720万美元 多年期慈善资助。官方声明里写得很完满:这笔分 3 至 5 年拨付的资金,将支撑平台作为独立非营利组织运转、升级底层技术,并应对 AI 带来的学术传播冲击。

但很多人没注意到前置事实:早在 2026 年 7 月 1 日,arXiv 就已经悄然脱离了托管它长达 25 年的康奈尔大学。这次所谓的自立门户,并不是功成名就后的主动单飞,而是一所顶尖高校在连年替它填补运营赤字后,选择卸下的沉重包袱。

arXiv 独立财务账本:光鲜捐赠与现实收支对照 多年期资助总额 $17.2M 分 3 至 5 年拨付 年均约 $344万 - $573万 非单年预算,未披露细分表 FY2025 实际收支 -$29.7万 实际支出:$671万 实际收入:$641万 278 家会员费占礼金收入 56% FY2026 预算缺口 -$46.5万 预计支出:$885万 预计收入:$838万 赤字持续扩大,由母体兜底终结

千万美元级支票,难解年年算不齐的日常账

外人很容易被千万美元的通告数字迷惑,以为这个老牌学术网站一夜暴富。如果把账本摊开,情况完全是另一回事。

这笔 1720 万美元的承诺分摊到 3 至 5 年,折算到每个财年其实只有 340 万至 570 万美元。对比 arXiv 的真实成本线,它刚好处在够用与吃紧的边缘。根据公开财务报告,arXiv 在 FY2025 财年实际支出达到 671 万美元,收入只有 641 万美元,净赤字 29.7 万美元。而在独立运作前的 FY2026 预算里,年支出更是拉升到了 885万美元,预算预期赤字拉大到 46.5 万美元。

在此之前,差额部分基本由托管方 Cornell Tech 默默贴钱消化。此前虽然有 Simons 基金会与 Schmidt Sciences 提供的 1000 万美元专项捐助,但那笔钱被严格锁死在云架构迁移与现代化改造上,无法挪作日常柴米油盐。

即便拿到了三家机构的新支票,arXiv 依然摆脱不了对 278家机构会员 的极度依赖。在 FY2025 财年,这批大学图书馆与研究机构交上来的年费,占到了礼金与会员类总收入的 56%。只要机构订阅预算稍有波动,新实体马上就会面临现金流紧缩。

  • 风险.独立并非财务自由,失去大学直接背书后,任何非营利实体都必须自行承担赤字爆仓的法律与破产代价。

权力重构之后,公共资产归了谁

脱离了大学行政编制,理论上能换来更灵活的薪酬和募资结构,但也带来了另一个尖锐问题:这个全球学者共享的枢纽,到底掌握在谁手里?

在制度设计上,arXiv 并没有走向完全去中心化的科研共同体自治。至 2031 年 7 月 31 日之前,康奈尔大学与 Simons 基金会各自在董事会中锁定了 4 个席位。哪怕董事会未来增选 4 名外部独立董事,两大创始机构依然稳稳捏着三分之二的法定表决权。

更耐人寻味的是出资方名单里的 XTX Markets。作为一家重度依赖算法与量化交易的做市商机构,其创始人近年在学术赞助领域极为活跃。虽然同行如生命科学预印本 bioRxiv 所在的 openRxiv 体系,早就用白纸黑字把编辑主权与出资方权责用防火墙隔开,但独立后的 arXiv 至今尚未公开详细的反利益冲突章程。

独立并不天然等于自治,权杖只是从一所大学的账房,移交给了私人基金会与资本巨擘把守的董事会。

一旦未来出现财务吃紧,或者在大模型训练集数据抓取、商业 API 定价等关键分水岭上出现分歧,掌握董事会多数票的核心出资方,究竟会将公共属性置于何地?这是整个科研界都在盯着的盲区。

学术公地之困:指数级通胀与志愿审核断裂 提交负荷:已成天文数字 2024年新增:244,031 篇 2025年新增:284,486 篇(单年飙升) 累计总提交量:超 317.9 万篇 月活超 500 万 / 累计下载超 38.2 亿次 AI 冲击:击穿轻度过滤防线 审核机制:无同行评审,仅靠志愿初筛 大模型后果:虚构与幻觉参考文献激增 审核危机:无偿志愿者时间被低质垃圾稀释 若强行引入商用风控,将伤害开放存取基因

泥沙俱下,大模型正在冲垮最后的防波堤

钱与权力还可以靠行政手段慢慢谈,技术基建上的隐疾却已经迫在眉睫。

从 1991 年物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室用一台机器写下最初的代码算起,arXiv 已经走了 35 年。它赖以生存的灵魂,不是什么严密的同行评议,而是一种极低成本的君子协定:依靠领域内的科学家志愿者做最基本的格式与内容初筛,不设繁琐审查,追求最快传播。

但这个默契在过去两年里被粗暴打破了。2025 日历年,arXiv 全年论文提交量猛增到了 284,486篇,而 2024 年这个数字还是 244,031 篇。截至 2026 年 9 月,平台累计提交已越过 317.9万篇,主站累计下载突破 38.2 亿次。

量级暴增的同时,质地正在迅速坍塌。针对 arXiv、bioRxiv、SSRN 以及 PubMed Central 的多方交叉研究直接揭穿了冰山一角:生成式 AI 泛滥之后,论文中出现完全虚构、大模型幻觉参考文献的比例急剧上浮。

古人讲「水之积也不厚,则其负大舟也无力」。当成千上万篇由模型批量生成、引用真假难辨的稿件如潮水般涌入,全靠义务劳动的审稿人防线几乎处于被穿透的边缘。

如果 arXiv 坚守轻量级审核,平台就会沦为大模型洗稿与学术灌水的垃圾场;如果它用这 1720 万美元去采购商业检测引擎,或者加设层层审查门槛,它就亲手扼杀了预印本诞生之初最宝贵的即时与开放。商业出版巨头爱思唯尔旗下的 SSRN 早就选了全面变现与严控路线,而 arXiv 走在独木桥上,每一步都在试探非营利模式的物理极限。

  • 结论.1720 万美元只能买来服务器的喘息,买不来对抗学术通胀的解药。