资深设计系统作者 Murphy Trueman 最近在他的电脑桌面上建了一个文件夹,名字叫文学墓园。
里面存放着大量他多年来习以为常的词汇与符号:破折号、genuinely、honest、quiet。每当写完一篇技术文章,他在公开前都要像搜寻违禁品一样通篇排查,把这些原本属于他个人语感的特征一个个删掉,换成毫无个性的逗号或更平淡的中性词。这么做的唯一理由,是前雇主与职场同事曾严厉警告:留着这些表达,大家会认定这是 AI 写的。
这不是孤例。在大模型席卷日常工作两年后,中文与英文互联网正在同时上演一场逆向图灵测试:为了自证清白,人类作者正忙着自我阉割,亲手把文章修饰得越来越不像机器,结果却把真正的人味彻底磨平。
机器入侵口语,群体数据坐实了风格污染
机器对人类行文方式的重构早已不是主观错觉。
德国普朗克人类发展研究所曾做过一项大规模追踪,调取了超过 82 万期播客节目中逾 737,083 小时 的即兴口语对话。研究证实,在 ChatGPT 问世之后,即使是原本完全不打草稿的人类即兴闲聊,delve、showcase、meticulous 等书面词汇的出现频次也出现了统计学跃升。在针对 496 人的受试实验中,研究人员更是发现,仅仅几分钟的人机交互,就会在无意识间让受试者在随后的对话中借用大模型偏好的词汇。
书面学术界的变化更剧烈。分析逾 69,000 篇 medRxiv 预印本论文发现,在 ChatGPT 发布前,论文讨论环节使用破折号的比例仅为 4.23%;而在发布后,这一比例迅速激增至 11.58%。
这种剧增引发了各大跨国机构与学术期刊对破折号等标点的社会性污名化。主流媒体甚至开始大篇幅报道编辑部针对特定标点的全面猎巫。然而,计算语言学界给出的定论非常明确:破折号与生僻动词只是群体层面的宏观统计学信号,根本不能用来当作认定单篇文本出自 AI 之手的确定性判据。
但猎巫一旦在职场和社区生根,辨识真伪的标准就会迅速退化成几个孤立的靶子。
归因偏差与共进化的西西弗斯陷阱
很多创作者把模型吐出怪异词汇的原因归结为早期人工反馈的偏好。然而事实远没有这么简单。
佛罗里达州立大学团队曾针对科学摘要里的 21 个高频词做过偏好测试。当招募来的 201 名受试者给论文开头的 delve 打分时,给出的评价几乎是全场最低分。实验表明,这个词的泛滥很难被粗暴解释为基于人类反馈的强化学习中人类标注员的私心奖赏。大语言模型之所以锁死某些高频修辞,更多来自其预训练语料本身的结构偏差,以及解码算法在寻找安全解时的概率收敛。
更为滑稽的是接下来的动态循环。
学术界将这种人类与机器的交锋定义为人类-大模型共进化。一旦某个词或标点被公众贴上 AI 味的负面标签,人类写作者就会在提示词里明令禁止模型使用它们,甚至在自己写稿时也绕道而行。
这种规避导致该特征在下一轮公开语料中迅速衰退。但当机器越来越擅长通过伪装技术抹平统计差异、逼近真实语感时,依赖静态特征来鉴别 AI 的审查者,就注定在打一场永远抓不到幽灵的仗。
- 风险.单凭几个孤立词汇或标点断定作者身份,极易造成对非母语创作者和受过严格技术写作训练者的系统性误伤。
人类亲手执行的模型坍塌
2024 年《自然》杂志的一篇里程碑论文证明:当大语言模型反复使用自身生成的数据迭代训练至第 9 轮时,长尾和罕见特征就会彻底消失,引发不可逆的模型坍塌。
但在现实世界里,根本不需要等到第 9 轮模型自循环。人类创作者在周遭猎巫目光的凝视下,正在用肉身替机器完成坍塌的过程。
抹平独特性以换取安全,人类写作者正在沦为亲手执行模型坍塌的降级算法。
清晰工整、善用破折号梳理复杂层级的语感,原本来自人类几十年来沉淀下的严谨技术写作与变革管理传统。机器因为学习了这种优质范式才变得有用;而现在,最懂这门手艺的人却不得不亲手掩埋自己的笔触,只为迎合审查者对粗糙感的畸形崇拜。
当文章的辨伪手段依然停留在查重、抓破折号和揪生僻词等外在形式上时,信任成本只会越来越高。真正负责任的创作从来关乎构思耗费的真实心力与推演逻辑,而不是把标点换回逗号的惊弓之鸟游戏。
削足适履自证清白,最终剩下的只会是一整个言语乏味、千人一面的平庸荒原。
