一篇发表于2002年、被引用超过2100次、写进无数经济学和心理学课程的经典论文,最近被三位统计侦探盯上了。最扎眼的数字是:在"最后一天截止"这一组的20名参与者里,有18人的三项校对成绩完全一致——三次任务,分毫不差。真实实验数据几乎不会长这样。Data Colada团队认定,这不是巧合,是篡改。
一场复现失败,捅开了20年前的旧账
故事起点是一次普通的复现研究。Hyndman和Bisin用124人和120人两批新样本重做了Ariely与Wertenbroch的Study 2,结果三项核心指标——发现错误数、迟交天数、报酬——在三种截止日期条件之间统计上毫无差异(F(2,121)=0.18, p=.835)。
原论文说的是另一个故事:分段截止日期组比最后一天截止组的表现好一倍,136.1次对71.1次纠错,效应量d=2.5。这个数字有多离谱?比男女身高差异的效应量(约1.8)还大,比很多"操纵检验"级别的强效应都夸张——一个校对任务的表现差异,居然比"论点数量影响对论点数量感知"这种理应100%成立的检验还强。
复现失败本身只能说明结果不稳健,够不上"造假"。让事情升级的,是Data Colada拿到了2006年从ariely@mit.edu发出的原始数据文件,做了一次法证式复盘。
四条证据链,拼出一个"人造"的实验
最直观的是"矫正孪生"现象:最后一天截止组20人里,18人能两两配对,三项任务纠错数完全相同,配对编号恰好相差10位——S1对S11,S7对S17。另外两组一例没有。
其他三条同样致命。主观体验的五项打分理应彼此正相关(喜欢任务的人通常也觉得有趣),复现数据的相关系数在0.63到0.92之间,原始数据却在-0.29到0.18之间晃,完全不相关。三项性质相近的校对任务,原始数据的任务间相关只有0.03到0.27,复现数据是0.74到0.90。记录时间的数字,原始数据里只有11.7%是整数,复现数据里这个比例是85%——真实的手写计时不会这么"干净"。
假作真时真亦假,伪造得越工整,漏洞往往越机械。
两位作者,两种态度
面对证据,两位作者的反应完全不同。Wertenbroch的表态是全面的:他公开承认数据"大部分或全部是虚假的",称Data Colada的法证分析比大多数研究者能做到的还精细严谨,并已要求现任主编Vazire撤稿。他还强调自己从未拿到过任何版本的原始数据。
Ariely的表态停在"承认异常,不解释细节"。他在声明里承认数据存在"严重异常",但对重复观察值、相关性坍塌、四舍五入模式这些具体证据,一条都没有解释,也没有承认伪造。更早之前,2024年10月,期刊编辑请Hyndman和Bisin把原始文件分析结果分享给Ariely并征求同意收入论文,Ariely拒绝了,理由是"这些文件可能不是真实数据"——但他此后也没提供任何其他版本的原始数据。
- 风险.如果最终裁定只对论文本身"打标签",不追问数据链条上谁动了手,这种"承认异常、回避细节"的模糊姿态会变成一种可复制的危机公关模板。
一篇论文倒下,一整条引用链跟着晃
《Psychological Science》目前按COPE程序审查,还没有正式撤稿结论。但影响已经外溢。这篇论文20多年来是"外部约束能提升自我管理"这一行为经济学命题的核心实证支柱,写进无数课程和教材。它的复现失败叠加造假证据,动摇的不只是一篇论文,还有引用它的2100多篇后续研究,以及所有把"设置外部截止日期"当作干预依据的产品和政策实践。
Precommitment这个理论主张本身未必错——愿意为自我约束付出成本,这在其他研究里可能仍站得住。但2002年这篇论文提供的具体证据,已经不能再被当作证据使用了。这才是这次法证复盘真正的杀伤力:它拆的不是一个数字,是二十年的学术信用。
