科技博主lcamtuf对Hacker News做了两轮系统抽样:2月和6月各抽取每日Top5故事,用AI检测工具Pangram判断内容是否与AI相关或由AI生成。结果是,2月约40%的每日头条与AI沾边,6月上半月这个数字冲到60%,月末回落到50%。这组数字被不少人当成"HN已被AI占领"的实锤转发,但它经不经得起细看,是另一回事。

40%到60%,具体发生了什么

2月28天里,有25天的Top5出现AI相关内容,只有2月1日、9日、25日是例外——那几天最靠前的AI故事也只排到第6到第10位。2月4日和12日,AI相关内容占了Top5里的4席;2月5日情况更极端,五条头条可能全部与AI有关,其中一条后来被作者认定是AI厂商的伪装软文。

被标记的样本里,有一篇题为《AI is not a coworker, it's an exoskeleton》的文章格外扎眼:拿到500+点赞和500+评论,却被Pangram判定带有大量AI写作特征。这类案例撑起了"AI正在批量占领HN"的叙事,但叙事和证据之间,还差一道关键的门槛没跨过。

HN头条AI占比 三次抽样 2月 40% 6月上半 60% 6月末 50% 每日Top5抽样,非全站普查

Pangram的判断依据是什么

Pangram的检测逻辑不靠找"非人类"痕迹,而是利用当前大模型的默认写作风格具有近似确定性——同一个提示词反复生成,风格会高度雷同。这套逻辑在官方最新技术报告里跑出了漂亮的分数:AUROC 0.9916,假阳性率0.0041%(约1/24000),假阴性率0.3396%。芝加哥大学一项独立研究也在自己的测试语料上得到接近零的误报和漏报率。

这些数字确实比早期检测工具好看得多。问题在于,它们是在受控语料上测出来的,而HN的真实文本充满短评论、技术术语、非母语英语、引用摘录、代码片段——这些恰恰是检测器容易失手的场景,Pangram官方自己也承认部分细分类别表现偏弱。

被误判的教师和2013年的科幻小说

HN社区里已经流传出具体反例。一篇讨论帖里,一名教师报告自己的原创文本被Pangram标记为AI写作,直到删掉三个项目符号才不再被标记。另一个更扎眼的案例:一篇写于2013年、早于任何主流大模型问世的人类科幻小说,同样被判定为AI生成。

另有研究发现,新注册HN账号使用破折号等排版标记的概率是老账号的约10倍(17.47% vs 1.83%),但排版习惯本身证明不了写作者是谁——爱用列表和破折号的人,可能只是刚好写作风格工整。《大西洋月刊》的评论说得直接:Pangram明显优于前辈,但如果它的输出被当成最终裁决使用,照样会出问题。

零假阳性率,救不了这个百分比

这里藏着一个容易被绕过去的统计学问题。假阳性率低,说的是"人类写的文本里,被误判为AI的比例很低";但读者真正关心的是反过来的问题——"被标记为AI的内容里,到底有多少真是AI写的",这是精确率,两者不是一回事。

如果HN真实语料里AI写作的实际比例本来就不高,那么即便误报率低到0.01%这个量级,最终"被标记为AI"的那堆内容里,误判的占比仍然可能不低——真实占比越低,这个落差越明显。这不是Pangram一家的毛病,而是所有依赖单一检测器给出"多少比例是AI"这类结论的通病。

低误报率解决不了base rate太低的问题,这是所有AI检测叙事共同的软肋
  • 提醒.抽样对象是每日Top5,不是HN全站帖子和评论,作者本人也把这称为"描述性观察",不是全站普查。

谁该多留一个心眼

对经常在HN、Reddit这类社区写长评论的人来说,写作风格工整、爱用列表和破折号,可能会无辜撞上检测器的枪口——教师那个案例已经证明这不是假设。对平台管理者而言,把检测结果直接拿来做限流或标注的依据,风险不小,尤其是在没有本地语料验证精确率的情况下。

接下来值得盯的,不是HN的AI占比又涨了几个点,而是Pangram这类工具能不能拿出针对论坛短文本、代码片段、非母语写作的专项精确率数据——目前看,这块空白还没人填上。