一篇论文里出现一个查无此人的作者,可能是录入错误,也可能是有人冒用了身份。但当类似名字出现在77篇论文中,事情就不再只是“AI写错了人名”。
报道把这些作者称为学术出版中的“AI幽灵”,并列出 Elena Vasquez、Marcus Chen 等名字。它们看起来像真实研究者,却缺少稳定的机构履历、研究轨迹或可核验身份。更麻烦的是,这些名字已经和论文记录发生了连接。
这件事最刺眼的地方,不是AI能编造一个像人的姓名。语言模型本来就擅长拼出“合理的人”。真正失守的是后面的验证链条:有人提交,期刊接收,数据库收录,读者再把它当成事实引用。
77篇论文暴露了什么
目前能确认的核心信息很简单:
| 问题 | 已知情况 | 不能直接推出的结论 |
|---|---|---|
| 出现了什么 | 至少77篇论文中出现疑似不存在的作者 | 不能据此断定77篇论文全部由AI生成 |
| 典型名字 | 报道提到 Elena Vasquez、Marcus Chen 等 | 不能仅凭名字判断作者是虚构的 |
| 影响在哪里 | 虚假身份进入论文署名和学术检索记录 | 不能直接证明所有数据库都已永久污染 |
| 争议焦点 | 论文作者是否经过真实身份核验 | 还需要逐篇核对机构、邮箱、DOI和投稿记录 |
这里有一个容易被忽略的区别:作者不存在,不等于论文内容一定错误;论文内容看起来正确,也不等于作者身份可以不查。
学术论文的署名承担两种责任。一种是知识责任,谁做了研究、写了论文;另一种是追责责任,出了问题之后,谁能解释数据、代码和结论。假作者一旦进入正式记录,这两条线都会变得模糊。
对于普通读者,最直接的影响是检索结果变得不那么可靠。论文标题、摘要和 DOI 都可能是真实存在的,但作者信息未必经得起核验。研究者在做文献综述时,可能把一篇可疑论文当成独立证据,再把它引用进自己的文章。
编辑和审稿人承受的压力更现实。投稿量增加、审稿周期缩短、跨机构合作变多,很多流程默认相信作者填入的信息。机器可以帮忙检查格式,却很难单独判断一个姓名背后是否有真实的人、真实的机构和真实的研究贡献。
问题不只在模型
语言模型会产生虚构人名,这并不新鲜。它也会编造论文、期刊、DOI和引用关系。过去,研究者通常把这类错误看成聊天机器人回答中的“幻觉”;现在,模型生成的内容开始进入投稿、摘要润色、参考文献整理和同行评审等环节,错误有了继续传播的出口。
学术出版原本就存在身份造假、论文工厂、买卖署名和虚假同行评审等问题。AI没有创造这些利益链,只是把伪造的成本压低了。过去需要一个人手工编出完整身份、机构和论文履历,现在模型可以迅速生成一套看起来相互匹配的材料。
这和早期互联网的信息污染有点像,但不完全一样。论坛里的假消息通常停留在页面上,论文却会进入 Crossref、Google Scholar、机构知识库或专业数据库,成为后续检索和引用的材料。错误一旦被多个系统同步,删除原文并不代表它已经从传播链条上消失。
我不太接受一种轻松的说法:发现几个假作者,说明AI还不够成熟。恰恰相反,这说明AI已经足够便宜、足够方便,能被嵌入一套本来就依赖信任和批量处理的系统。
谁会先付出代价
受影响最直接的是两类人。
研究者会多出一项原本不该由个人承担的工作:确认合作者和引用文献是否真实。查一个作者,至少要看机构主页、ORCID、个人邮箱、研究方向是否连续,以及论文之间是否存在可解释的合作关系。查 DOI 时,也不能只看链接能否打开,还要核对作者顺序、机构信息、期刊页面和文章版本。
年轻研究者尤其吃亏。他们常常依赖数据库和导师推荐的文献,缺少时间逐条核查。一篇可疑论文如果已经被引用多次,后来者很难判断自己看到的是可靠证据,还是一条被重复放大的错误记录。
期刊也不能把责任推给作者或模型。更有效的审核至少应该包括:
- 署名作者的机构邮箱或身份验证;
- ORCID 与既有论文记录的交叉检查;
- 作者贡献说明,而不是只收集姓名和单位;
- 对异常短时间内大量投稿、异常相似作者画像的筛查;
- 发现问题后公开更正、撤稿和数据库同步机制。
这些措施会增加编辑成本,也可能误伤没有公开主页、跨国流动频繁或使用化名发表的真实研究者。所以,姓名可疑只能触发核查,不能直接变成定罪依据。学术系统若把“没有网络痕迹”当成“不是人”,同样会制造新的偏见。
接下来要看什么
这起事件的价值,不在于把77篇论文全部贴上“AI生成”的标签。更重要的是看调查能否公开它的检索范围、判定标准和逐篇证据:哪些作者被确认不存在,哪些只是无法核验,论文的 DOI 和索引状态又是什么。
这决定了事件究竟是一个醒目的个案,还是一种可重复的流程漏洞。
还要看平台会不会采取动作。数据库能否标记可疑作者?期刊是否会补充身份核验?撤稿之后,引用数据库、机构网页和搜索引擎是否会同步更新?这些问题比“模型会不会继续编名字”更接近现实。
《史记》说:“天下熙熙,皆为利来。”学术出版也有自己的利益压力:期刊要提高产出,作者要增加论文,平台要扩大收录,模型供应商要证明工具有用。每个环节都可能觉得自己只负责一小步,最后却共同制造了一条没人真正负责的记录。
AI生成假作者,说明模型会犯错;77篇论文能留下这些名字,说明系统允许错误被当成身份、被当成署名、被当成知识来源。
论文数量可以批量生产,责任不能。
