Oxide Computer联合创始人Bryan Cantrill在9月5日发文《The revolt of the reader》,抛出一个判断:读者已经能一眼看穿LLM代写的文章,而且正在集体用脚投票——发现AI痕迹就弃读,甚至以后都不再看这个作者的东西。他给出的证据是一份开发者调查:78%的受访者一发现AI写作痕迹就立刻停止阅读,71%以后会主动回避该作者,98%更偏好作者本人不完美但真实的文字。这几个数字确实扎眼,但扎眼不代表站得住。
读者厌恶AI代写,这件事本身不新鲜
Cantrill不是第一次谈这个话题。去年12月他写过《Your intellectual fly is open》,说LLM生成的文章有一套可识别的结构性破绽——比如那句被他反复吐槽的"and here's why that framing matters"——一旦读者读得足够多,这些破绽就像敞开的裤链一样藏不住。今年8月,Oxide把这个观点写进了内部文档RFD 576:读者不该被迫花比作者自己都没花的力气去理解一段文字,这是作者和读者之间的"社会契约",LLM代写打破了它。这次的博文,是把风格判断、契约理论和一份具体调查数据拼在一起,讲成一个完整的故事。
那份被反复引用的调查,方法论其实很单薄
这份调查来自Cynthia Dunlop在6月中旬发布的《How developers react to AI-scented blog posts》,通过X、Bluesky、LinkedIn匿名分发,收到668份回复。问题在于,这是一个典型的自选样本:没有人口统计学核实、没有抽样框架、也没披露回复率或误差范围,作者本人也承认无法保证代表性。更关键的一点是,调查测量的是受访者对"疑似AI写作"内容的反应,而不是他们真的识别AI文本的准确率——78%和98%说明的是这群人对"感觉像AI"的东西有多反感,不能直接等同于"所有开发者"的态度。
Cantrill的引用还只是这份调查的一部分。同一份数据里,57%的受访者表示会对疑似AI写作的内容点踩,85%把自己对AI代写的担忧程度打到满分5分(另有11%打4分)。这些数字同样支持他的论点,但原文没提。选择性引用不代表数据造假,却说明这篇博文更像是拿数据佐证既有立场,而不是先看数据再下结论。
检测技术刚刚跨过门槛,垃圾邮件的类比还差一口气
Cantrill这篇文章真正的支点,其实是检测技术。他承认自己早年试过用LLM自我检测LLM文本,假阴性率高得离谱;也试过基于表面特征(比如破折号用法)的检测方法,结果广泛不可靠。真正让他改变态度的是Pangram Labs去年底推出的Pangram 3、最近发布的Pangram 4——他形容这是"跨越式"的准确率提升,假阳性率和假阴性率都压得很低。基于这个判断,Oxide在RFD 576里明确要求:公开文章必须能被Pangram判定为人类撰写。
他把这套逻辑类比成2000年代的垃圾邮件治理史:早期人人担心垃圾邮件会拖垮email这个"杀手级应用",直到过滤技术成熟,垃圾邮件的经济学被彻底打穿,"被标记为垃圾邮件"本身变成品牌的毒药。但这个类比有一处明显的不对称——垃圾邮件的衰败靠的是过滤技术、经济成本、域名黑名单和ISP协作四件事一起发力,形成了行业级的基础设施。而AI写作检测目前基本只靠Pangram这一类第三方工具的模型判断,还没有形成同等级别的行业协作或经济惩罚机制。技术是不是真的到了那个拐点,现在下结论还早。
- 风险.Pangram的准确率目前主要来自Cantrill个人使用体验,尚未见到独立于其视角之外的第三方验证数据。
读者的厚脸皮已经磨没了,但检测技术的地基还没打完。
谁会先感到这股压力
最先要面对这件事的是靠专业内容立信誉的技术作者和企业博客——一旦读者养成"先过一遍AI检测再决定要不要读"的习惯,被贴上"AI代写"标签的代价会越来越像被标记为垃圾邮件域名,是声誉层面的硬伤。Oxide已经把这套标准写进内部规范,这更像一种提前下注,赌的是检测工具的准确率能跟上读者的耐心消耗速度。接下来值得盯的是两件事:Pangram类工具的准确率有没有独立机构验证,以及会不会有别的公司或媒体机构跟进类似的内部写作规范——如果只有Oxide一家在这么做,"读者反抗"更像是一个正在酝酿的预言,还不是已经成型的行业惯例。
这套论证链条从个人观察走到调查数据、再走到检测技术和历史类比,一环扣一环,读起来很顺。但每一环单独拆开看,证据强度都打了折扣:调查是自选样本,检测工具的准确率还缺第三方背书,垃圾邮件类比缺的是同等级的基础设施。读者的厌恶是真的,Cantrill个人的判断力也值得信任,只是把这份判断包装成"数据证实的行业共识",还差着一段路。
