两名研究者今年夏天分别为NeurIPS、WACV和ECCV旗下的TerraBytes地理空间工作坊做审稿人,两人合计接手22篇投稿,结果15篇——占比68%——被他们判定存在虚构引用、伪造作者信息,或明显是AI生成的文字。更棘手的是,其中两篇被他们直接举报“作者名单造假”的论文,最后仍拿到了口头报告资格,会议方给出的处理意见只是“把引用改对就行”。

这件事真正值得追问的不是论文能不能用AI写——两位审稿人自己也天天用Claude起草文字——而是同行评审这道关卡为什么拦不住没人核实过的内容,以及虚假引用要不要被列为一票否决的红线。

造假引用已经不是个案

68%这个数字来自两名审稿人手上的22篇分配稿,样本很小,不能代表NeurIPS、WACV或整个学术出版体系的真实比例。但把它放进更大的审计数据里看,方向是一致的。今年4月《自然》一篇分析估计,2025年至少有数万篇论文“很可能”含有无效的AI生成引用;针对arXiv、bioRxiv、SSRN和PubMed Central的一项审计估算,仅2025年就有约14.69万条幻觉引用,且这些造假分散在大量论文里,而不是集中在少数人身上。

《柳叶刀》对250万篇生物医学论文的审计显示,含至少一条伪造引用的论文比例在两年内涨了六倍:2023年是每2828篇里1篇,2025年变成每458篇1篇,2026年初已经到了每277篇1篇。更值得警惕的是,一项针对NeurIPS 2025已录用论文的分析发现,抽取的100条幻觉引用全部通过了3到5名评审专家的审核,携带这些引用的53篇论文——约占录用总数的1%——如今就摆在正式论文集里。也就是说,虚假引用不只是漏网之鱼,它已经在顶会的正式记录里留下痕迹。

AI两头下注:论文在造假,评审也在偷懒

问题不只发生在投稿端。Pangram对ICLR 2026评审意见的检测发现,21%(约1.59万条)评审是AI完全生成的,超过一半有AI参与的痕迹;管理学期刊《Organization Science》的一项统计显示,ChatGPT普及后投稿量激增42%,超过三成的评审现在会用到AI。ICML 2026甚至在投稿里埋了提示注入陷阱来抓人,结果查出795条评审(约占全部评审的1%)出自被明确要求“禁止用LLM”的506名评审员之手。

这套系统还能被反过来操纵。一项研究发现,对论文摘要做对抗性改写,能在不改变实际科学内容的前提下拉高AI评审给出的分数,成功率最高约38%,让Gemini 3 Flash评审的接受度评分平均提高1.31分、GPT 5.4 Mini提高0.88分(满分10分制)。

论文端塞进假引用,评审端用AI糊弄评审——两头都在省时间,中间没人核实。
  • 风险.两篇被举报伪造作者的论文最终仍获口头报告资格,只被要求补改引用,说明至少在这两起个案里,虚假引用没有被当成投稿资格问题处理。

底线该划在哪

两位审稿人反复强调的一点是,他们不反对用AI辅助写作——博客本身的草稿也是AI起草的,但每一句都经过他们核对、改写、验证。真正的分界线在于:作者有没有为引用、数据和最终文本的真实性负责。

一个具体的识别技巧值得记住:论文正文里的指标数字如果和表格对不上,往往是作者改完实验、却忘了让AI同步更新文字描述的痕迹。这类线索比满篇的破折号和“不是A而是B”句式更可靠,也更能说明问题——不是文字像不像AI写的,而是作者到底有没有回头核对过自己的论文。

对研究者来说,投稿前逐条核对参考文献、检查正文数字与表格是否一致,是眼下最省力也最必要的自查动作。对会议组织者来说,真正待解决的问题是:虚假引用要不要成为直接拒稿的硬门槛,而不是像目前个别案例那样,改一改就能过关。