四月的一天,r/AskHistorians 的版主群突然被系统提醒淹没。几十条追溯到十年前的问答帖子和评论,一夜之间被自动清空,其中不少是专业研究者花几小时甚至几天写出来的详细回答。版主事后排查发现,这些帖子有一个共同点:都引用了一个历史图片网站 Rare Historical Photos 做配图说明。Reddit 大概把这个网站标成了垃圾链接,于是任何引用它的内容,不论多严肃,都被一并清掉。
版主们没有任何申诉渠道能挽回这些内容——这是这次事故最扎眼的地方,也是理解整件事最好的入口。
数字很漂亮,误伤也很真实
Reddit 官方公布的战报确实好看:AI 把针对仇恨与暴力内容的执法量提高了200%以上,把用户接触到有害内容的比例降低了40%以上,每天撤销近200万张虚假投票,还拦下2300万次垫钓浏览。这些数字支撑的叙事是——AI 让治理变快了、变大了。
但 AskHistorians 的误删说明,这套统计里很可能混进了不该算的"战果":一次误判也会被记成一次"成功拦截"。Discord 的案例更直接。今年五月到七月,Discord 的 AI 审核系统把棋盘、表格这类带方格图案的图片误判成儿童性虐待材料,连坐永久封禁了约8400个账号。公司事后承认,本该由人工复核的这一步,被一个 bug 绕过了——AI 自己就把账号封了。
平台各自在补哪块拼图
三家平台今年给出的答案不太一样,拼在一起能看出这场"AI打AI"到底卡在哪。
Reddit 靠社区投票、志愿版主和 AI 复核撑起三层结构,但 AskHistorians 事件证明第三层出错时,前两层根本救不了内容。Meta 的思路是把"AI生成"和"垛钓行为"分开处理——单纯用 AI 写的东西不算违规,真正被打的是重复刷屏、蹭标签、协同互动这类操纵分发的行为,今年3月还专门推了"原创内容奖励"政策。YouTube 则在5月更新里承诺,系统会自动给未主动披露的高逼真 AI 内容打标签,但标签打了之后,推荐权重和营利资格照旧不受影响。
三家平台的共同问题:标注和惩罚是两件事,而外界一直以为它们是一件事。
AI 打 AI,输在时间差
这场治理的死结不在算法笨,在于两边根本不在同一个时间轴上。生成式模型迭代一次可能就是几周,检测模型要训练、上线、观察、再修正,周期天然更长。Rare Historical Photos 这类被错杀的网站,大概率是因为某批新型垫钓账号也用了类似的图片托管方式,系统学到了"用这类外链的账号大概率是垫钓"这条粗糙规则,然后一刀切下去——历史学家和垫钓号,在这条规则面前长得一样。
古人说"察言观色",看的是语境,不是表面特征。今天的自动审核系统恰恰缺这一层——它能识别模式,但读不出十年积累和一次性刷屏之间的分量差别。
- 风险.把误删计入"执法成效",战报会越漂亮,系统里的盲区就越容易被掩盖。
Meta 和 YouTube 把"标注"和"惩罚"拆开,表面上是谨慎,实际上也是回避——真正决定内容命运的分发权重和营利资格,依然绕开了"这是不是AI生成"这个问题,只看行为模式。这算是一种务实,但也留了个口子:只要不明显重复刷屏,批量生成的内容依然能顺利拿到流量。
人不是退步方案,是唯一没有时间差的一环
Discord 事后承认,人工复核那一步不是摆设,是真正的保险丝——保险丝被绕过,才有了八千多个错误封号。这恰恰说明,人工审核不是AI时代的过渡产物,而是唯一能跟上语境变化速度的环节。
机器筛得快,人心才辨得准。
志愿版主的处境值得多说一句。AskHistorians 这类靠专业内容立身的社区,版主本就是无偿劳动,现在还要额外承担"帮AI擦屁股"的申诉与核查工作。AI 检测的规模越大,人工兜底的工作量就越涨,这笔账目前没有哪家平台愿意公开算清楚。
- 结论.真正该盯的不是哪家AI审核更强,而是误判发生后,平台留没留人给用户说话的通道。
十年积累一夜清空,靠的不是恶意,是系统学错了一条规则。这提醒所有还在指望"用更强的AI来防AI乱象"的平台:治理的最后一道墙,从来不是模型能力,是有没有人愿意为一次误判负责。
