一篇号称发表在《美国科学院院刊》(PNAS)上的研究,最近被大量转述为"X的算法专门用愤怒内容喂民主党用户"。故事讲得很顺:714人的全国代表性样本,19维价值观量表,算法优先学习"回复"这种稀有互动,形成越吵越推、越推越吵的循环。
但按报道给出的DOI去查,这篇论文对不上号。检索不到与该DOI匹配的确切文章,无法确认标题、作者列表和发表状态。这不是小事——一篇支撑"X系统性伤害民主党人"这种重判断的论文,如果连出处都对不上,后面的解读就都成了悬空的推理。
6.8%回复撑起的"愤怒循环"叙事
报道里的核心机制其实很精巧:用户点赞、转发是常规互动,算法照常推同类内容;但回复只占互动的6.8%,却被算法当作更强的信号加权学习。你越回怼一条让你生气的帖子,系统越觉得你"喜欢"这类内容,接着推更多。研究说,这个循环在自称民主党人的用户身上更明显,但作者自己也说不清是X上右翼内容本来就多,还是民主党用户更爱下场吵架。
这个机制听起来合理,也符合过去几年对社交媒体算法的普遍怀疑——从Facebook到早期Twitter,"情绪化内容更容易被算法放大"早已不是新闻。问题是,合理的机制猜想和坐实的因果结论,是两件事。
可查证的另一篇论文,说的是另一件事
与论文作者Ziv Epstein相关、且能查到的一篇公开论文(arXiv 2509.14434),讲的其实是另一套实验。它不是714人的观察性研究,而是两组受控实验,样本分别是141人和250人,测的是"按用户价值观重排序后的feed,和X原始排序差多少"。结果是两者的相关系数(Kendall's τ)只有约0.06——重排序确实能明显改变内容,用户也能感知到差异。
但这篇可查证的论文,没有直接测量ragebait,也没有做民主党和共和党的对比检验。换句话说,"民主党用户被愤怒循环困住"这个具体结论,在能核实的那篇论文里根本找不到对应证据。它更像是把一个机制性猜想,套上了一个听起来更耸动的党派叙事。
同一批研究者的另一篇文章还提到,人类评委之间、以及人类和GPT-4o之间,对帖子"价值表达"的判断一致性并不高——这意味着用大模型给帖子打19维价值分本身,信效度就存疑,拿它做因果推断的地基并不牢。
一项独立的Nature实验,方向反着来
更值得对照的是另一项方法更严格、样本更大的研究:2026年2月发表于《自然》的《The political effects of X's feed algorithm》,用的是真正的随机对照实验,基线调查超过六千人,主分析样本近五千人,时间点是2023年7到9月。
它的结论是:打开算法feed会让用户整体观点更趋向保守——更认同保守政策议题、更反对对特朗普的刑事调查、在乌克兰战争上更偏向亲克里姆林宫立场。但这项实验没有发现党派认同或情感极化出现统计显著变化。方向和"民主党人专门被愤怒内容围猎"完全不是一回事。
两项研究测的都是"X的算法",却在关键结论上各说各话。这不代表哪一方在造假,更可能说明,用观察性数据和用严格RCT得出的"算法效应",本身就不是一回事,读者不该把任何一份单独拿出来当定论。
- 风险.把"机制上合理"直接读成"因果上坐实",是这类算法研究报道最容易踩的坑。
读者该怎么看这类"算法有偏见"的研究
对普通用户来说,实际能确认的部分不多:算法确实倾向放大能带来互动的内容,回复、争论这类强互动更容易被系统学习,这一点在多篇研究里方向一致。但具体到"哪个党派被伤害更多",目前证据链并不闭环——一篇引用信息核实不了,另一篇设计不同、没测党派差异,第三篇独立RCT方向还相反。
对做政治传播或者社媒运营的人,更实际的提醒是:在X上回怼一条让自己生气的帖子,大概率会换来更多同类内容,这个操作层面的建议,比"哪个党派更受害"的结论更可靠,也更值得记住。
至于X本身,报道方多次尝试联系置评,都没有回应——算法排序权重到底怎么定,外部研究者仍然只能靠插件采集数据去猜。
