一份跟踪arXiv论文写作风格三年半的检测显示,最近一个完整季度里,约32%的新发表论文被判定为带有机器写作特征,2026年初一度逼近39%。这个数字来自一次不算小的抽样:12750篇论文,覆盖10个学科,时间跨度从2023年1月到2026年7月,外加2021到2022年两年里专门挑出的对照样本。
数字够扎眼,但把它读成“三成论文是AI生成”是最容易犯的错。检测器本身带误判率,统计口径决定了这32%到底在量什么——它更像是学术写作里“机器腔”变多的证据,而不是AI代笔比例的判决书。
从0.4%到32%,三年半里发生了什么
研究把2021到2022年——ChatGPT问世之前——的论文当作“确定是人写的”对照组,把检测阈值定在这批文本恰好有0.4%会被误判为机器写作的位置。这0.4%是整套统计的地基:之后报告的每一个百分比,都是在“人写文本本该只触发0.4%”这条线之上的份额。
检测对象是论文正式提交的第一版全文,而不是摘要。原因很直接:同一篇论文,摘要打分可能不到20%,正文能打到70%以上——摘要写得规整,水分都在正文里。按这套口径,检测器对已知AI学术文本的召回率约为85%。
结果分两波往上走:2021到2022年基本贴着0.4%的地基,ChatGPT发布几个月后开始起飞,爬到最近一个完整季度的32%,2026年初摸到39%的高点。学科之间差得很远——计算机科学最近12个月的占比接近65%,数学只有0.7%。
读起来像AI,不等于是AI写的。
为什么重要:机器味不是代笔认定书
对写论文的人和管审稿的人,这组数字划出了一条现实边界。AI辅助写作已经是计算机科学、量化生物学、电子工程等学科里司空见惯的写作方式,不再是零星现象。但“机器写作特征”这个判断,和“这篇论文是谁写的”“AI生成了多少比例”“有没有违规”是三件不同的事——检测器给出的是文本风格的概率估计,不是身份证明。
- 结论.AI辅助写作已经从个别现象变成部分学科的常态化写作方式,期刊和审稿人需要调整的是流程预期,而不是拿单一分数去定性某篇稿子或某位作者。
对作者来说,分数低不代表可以放心,分数高也不该被直接扣上“代写”的帽子——单一检测结果从来不该成为指控个人的依据。对期刊和科研诚信管理者来说,这类工具更适合用来观察学科层面的写作趋势,不宜当作独立的审稿或处罚证据。
数学0.7%,恰恰是最需要小心的数字
数学论文最容易被误读。这个学科检测出的机器写作比例最低,只有0.7%,但这不等于数学领域几乎没人用AI辅助写作。数学论文的正文由公式、定理和证明撑起来,去掉公式和引用之后剩下的文字很少,风格也和检测器训练时见过的科研英语不一样,容易在这类稀疏、结构化的文本上失灵。0.7%更可能说明检测器读不懂数学论文的写作习惯,而不是数学家不用AI。
- 风险.低占比学科的数字更像探测下限,不是真实使用率;把它当作“这个领域AI用得少”的证据,是这份数据最容易被误读的地方。
对照组本身也不宽裕。每个学科的ChatGPT之前对照样本只有200篇,0.4%的误判率意味着整组2000篇对照论文里只有大约8篇会触发检测,分摊到10个学科后,每个学科的基线数字只能算粗略参考。检测器也覆盖不了作者实际用的全部模型和提示词组合,报告出来的比例更接近机器写作特征的下限,而不是上限。
