一个关于国际象棋引擎的GitHub讨论帖,最近被程序员博主fogus翻出来当作一个观察的起点。帖子本身信息量不大,但他借此写下一个判断:OSDev、demoscene、code golf、EmuDev这类小众编程圈子,正在变得越来越排斥用LLM写代码。这不是孤例,而是他在多个硬核爱好者社区里反复看到的同一种情绪。

fogus的论点很直白:这些圈子把"啃下一个难题的过程"本身当作产品,代码能不能跑只是附带品。用LLM直接生成成品,不会让人变成匠人,只会偷走本该属于匠人的那段磨练。这话说得漂亮,但仔细看会发现,它建立在一个GitHub帖子和几次个人观察之上,没有任何数据支撑。

"过程即产品":老规矩为什么容不下AI

demoscene比谁能把实时特效塞进最小的可执行文件,code golf比谁的代码最短,OSDev、EmuDev则是从零造操作系统和模拟器。这些圈子的共同点是:声誉靠时间攒,不靠交付物。你要在论坛里活跃多年,分享过足够优雅的代码,展现过真实的好奇心,才能被认可——圈内人根本不在乎你的代码是否能跑,只在乎你知不知道它为什么能跑。

这种文化和"LLM能快速生成可用代码"的叙事天然对撞。LLM绕过的恰恰是这些社区赖以维系身份认同的那段苦功,难怪一部分老成员的反应接近本能排斥,把用AI写代码等同于作弊。


数据站在谁那边:资深越用越慢,新手越用越快

问题是,这种排斥到底有没有证据支撑?过去两年,学界确实攒了一批关于LLM编程助手效果的实证研究,结论并不统一,而是高度依赖使用者的经验水平

Peng等人2023年的随机对照实验发现,用Copilot完成一项独立JavaScript任务,速度比不用快55.8%。Cui等人2024年针对数千名企业开发者的田野实验也发现,生成式AI让任务完成量提升约26%,而且经验较少的开发者获益更明显。这两项研究看起来都支持"AI是效率工具",和小众社区"AI是作弊"的判断正好相反。

但METR在2025年的一项研究给出了反直觉的结果:在熟悉的真实代码仓库里工作的资深开源维护者,用当时最新的AI工具反而比不用慢了19%——而这些开发者在使用前普遍预期AI会让自己更快,用完之后依然主观认为AI帮了自己。

这个发现恰好接住了硬核社区的直觉:越有经验、越熟悉一件事的人,越容易被AI的"看起来很对"的产出带偏,却浑然不觉。

AI辅助编程,效果因人而异 新手/学生 · Peng 2023 +55.8% 速度 企业开发者 · Cui 2024 +26% 产出 资深维护者·熟悉代码库 · METR 2025 -19% 速度,却自认更快 同一类工具,三种人群,三种结果
越老练的开发者,越容易被AI的自信语气骗过而不自知。

争议还没资格叫争议:样本缺口在哪

真正的问题是,上面这些研究的对象,不是刚入门的学生,就是企业里朝九晚五的专业开发者。没有一项专门研究过demoscene、code golf这类业余爱好者社区的成员。这两类人的动机、时间压力、外部评价机制完全不同——企业开发者要交付,爱好者要的是圈内认可。直接把METR或Peng的结论套到硬核社区头上,存在明显的人群错配。

换句话说,fogus的判断目前只能算一个尚未被验证的假设,靠的是零星观察和一种"感觉像是这样"的直觉,不是数据。

技术层面也有真实的理由支撑"必须理解代码为何工作"这条老规矩。Spracklen等人2024年的研究发现,代码生成模型会频繁推荐不存在的软件包,商业模型表现更好但并非免疫。Kabir等人2024年的研究更值得警惕:专家评估ChatGPT对编程问题的回答时,发现相当比例内容有误,但用户常常因为回答自信、详细而更偏好它——说服力被误认成正确性。fogus自己在原文脚注里也承认,专家身份不能天然免疫于被LLM误导,和这个发现刚好呼应。

  • 风险.目前关于"业余爱好者用AI是否损害学习"的证据完全缺失,现有一切类比都是借用别的人群的数据,存在错配风险。
  • 结论.硬核社区的排斥里,合理的技能保护和身份地位焦虑混在一起,原文没有区分,读者也不该替它区分。

这场争论接下来会往哪走,值得盯的是这些社区是否会从非正式的社会排斥走向正式立规——比如像某些编程比赛那样要求申报是否用过AI工具。在那之前,这更像是一群手艺人凭经验守住的一条底线,还没轮到数据说话。