关于拖延症一项有影响力研究中的欺诈证据
摘要
一项复制研究未能重现一篇2022年关于拖延症与截止日期的论文发现,引发对原始有影响力研究数据欺诈的指控。
暂无内容
查看缓存全文
缓存时间: 2026/09/01 12:30
# [138] 人为截止日期(上):一项关于拖延症的高影响力研究中的欺诈证据
来源:https://datacolada.org/138
《心理科学》期刊近期发表的一篇新论文报告了未能成功复制艾瑞利和沃滕布罗奇那篇题为“拖延、截止日期与表现:通过预先承诺实现自我控制”的有影响力文章中的研究2。原始研究于2002年在《心理科学》发表,发现当每项任务都有外部设定的截止日期时,人们在一系列任务上的表现优于自行设定截止日期或所有任务共用最后一个截止日期的情况。这篇论文影响深远,被许多经济学和心理学课程列为必读文献,在谷歌学术上被引用超过2100次。
由于这篇论文影响力如此之大,我们有必要仔细审视原始研究,试图理解其无法复制的原因。我们确实这样做了。本文以及下一篇文章,将阐述我们的发现。
***
大约20年前,即2006年4月20日,即将发表的复制研究的作者之一凯尔·海德曼,从[[email protected]](https://datacolada.org/cdn-cgi/l/email-protection)[1 (https://datacolada.org/138#footnote_1_10014)]收到一封电子邮件,其中包含了原始数据文件。大约3年前,即2023年8月9日,弗朗西斯卡·吉诺起诉我们索赔2500万美元一周后,我们收到了海德曼一封出乎意料的邮件,他将这些文件发送给了我们。我们快速分析了数据,然后与海德曼及其合作者阿尔贝托·比辛进行了交谈。在那次交谈中,他们告诉我们他们打算进行复制研究,由于我们忙于诉讼,此事便暂且搁置。
我们最近得知他们的复制研究即将在《心理科学》发表。阅读其论文的脚注14后,我们还了解到:
……根据编辑的要求,我们在2024年10月与丹·艾瑞利分享了对据称用于其研究2的文件内容的分析,并请求允许在论文中包含其摘要。丹·艾瑞利拒绝了我们的请求,并辩称我们收到的文件可能不是实际数据,等等。他此后并未向我们提供原始论文的任何额外数据。因此,我们无法用2006年收到的文件中的任何额外分析或任何其他数据来补充我们的复制研究。
这促使我们重新审视这篇论文,并对两项主要研究的原始数据进行了全面分析。我们得出结论:研究1和研究2的数据被篡改了。在两篇文章中,我们将呈现得出这一结论的证据。今天的文章聚焦于未能复制的研究(研究2),下一篇文章将讨论研究1。
我们关于数据被篡改的评估完全基于我们文章中呈现的分析。读者可以自行审阅证据并得出自己的结论。
据我们所知,克劳斯·沃滕布罗奇从未接触过任何研究的任何版本数据。并且,我们相信,正是因为他,我们才得以获得这些数据。当凯尔·海德曼在2006年联系原始作者时,克劳斯回复了这封邮件[2 (https://datacolada.org/138#footnote_2_10014)]:
我们的ResearchBox (https://researchbox.org/7135?PEER_REVIEW_passcode=GXBLRW)包含了重现本文所有结果的数据和代码。https://datacolada.org/138#_ednref1
最后,需要指出的是,几周前我们将这些文章分享给艾瑞利和沃滕布罗奇后,他们联系了《心理科学》期刊,请求撤回该文章。截至本文撰写时,该流程正在进行中。
**未能复制的研究:艾瑞利和沃滕布罗奇(2002)的研究2**
如前所述,艾瑞利和沃滕布罗奇探讨了截止日期如何影响表现。在一个人们需要执行多项任务的情境下,作者假设,与所有任务都在最后期限完成相比,人们在面对这些任务均匀分布的截止日期时表现会更好。
实验涉及一项有激励的校对任务。每位参与者收到三份10页的文档,每份包含100处“语法和拼写错误”(p. 222)。参与者的任务是找出并纠正这些错误。
60名参与者被随机分配到三种条件之一,每种条件正好20人:
**条件1:均匀分布的截止日期。** 一份文档每周截止一次,即在第7、14和21天后截止。 **条件2:自行设定截止日期。** 参与者在21天内自行选择截止日期。 **条件3:最后一天截止。** 所有三份文档都在最后(第21天)截止。
结果完美且有力地支持了作者的假设。在表现、延迟和收入方面,被给予均匀分布截止日期的参与者表现要好得多[3 (https://datacolada.org/138#footnote_3_10014)]。
**我们拥有原始数据吗?**
回顾一下,2023年海德曼给我们发送了他于2006年从[[email protected]](https://datacolada.org/cdn-cgi/l/email-protection)收到的文件。有三个Excel文件——试点研究、研究1和研究2的数据——所有文件的属性都表明数据是“由丹·艾瑞利最后保存”。
使用这些文件,我们能够重现上图中显示的所有九个均值和九个标准误,如下脚注所示:[4 (https://datacolada.org/138#footnote_4_10014)]。我们还成功重现了文本中报告的另外六个均值[5 (https://datacolada.org/138#footnote_5_10014)]。
**危险信号**
在我们的分析中,我们发现了四个主要危险信号。我们依次讨论每一个。
**危险信号 #1:效应量过大**
如上图所示,艾瑞利和沃滕布罗奇报告了一个完美的结果模式,涉及所有三个因变量,每种条件的样本量仅为20人。效应量也很大。极大,大到令人难以置信。
以校对表现结果为例。被给予均匀分布截止日期的参与者平均纠正了136.1处错误,而被给予最后一天截止日期的参与者平均只纠正了71.1处错误,大约只有一半。该效应的科恩d值为2.5,表明条件均值之间相差2.5个标准差。实验条件与纠正数量之间的相关系数为r = .79。
为了理解这个效应有多大,可以将其置于其他效应量的背景下考虑。d = 2.5的效应量大于我们在日常生活中注意到的明显效应,那些效应肉眼可见。例如,它远大于性别对身高(男性更高:d ≈ 1.8)和拥有鞋子数量(女性拥有更多鞋子:d ≈ 1.2;参见[Colada[18]](https://datacolada.org/18))的影响。它也大于一些操纵检查。例如,佩蒂和卡奇奥波(1984)报告说,接触包含九个论点信息的参与者表示他们遇到的论点多于接触包含三个论点信息的人。这理应如此。确实如此,但程度仅为d = 1.49 [6 (https://datacolada.org/138#footnote_6_10014)]。认为截止日期对校对表现的影响强于论点数量对感知论点数量的影响,这并不合理。
大于或等于2.5的效应量并非不可能——有时在操纵检查中会观察到——但对于非明显的心理学发现,尤其是对于像校对错误检测这样可能包含噪音、且在人群中变异性很高的测量来说,它们极其罕见。
理解这个效应巨大的另一种方式是查看因变量在不同条件下的分布。下图显示它们几乎没有重叠。例如,在最后一天截止条件下,没有人纠正超过100处错误,而在均匀分布截止日期条件下,90%的参与者做到了:
**危险信号 #2:重复观测值**
如果查看图2时你想到,“等等,为什么有那么多标有‘2’的红色柱子?”,这确实很奇怪。数字2代表在三个任务中总共找到完全相同校正数量的人。但实际情况更奇怪。这些参与者不仅总共找到的校正数量相同,而且在*三个单独的*校对任务中的每一项都做出了相同数量的校正。
以下是原始数据文件的截图,经过格式化和排序以便于阅读:
我们看到,在最后一天截止条件下的20名参与者中,有18名存在一个“校正双胞胎”,即另一个参与者在每项校对任务中发现的错误数量完全相同。有趣的是,这些双胞胎的ID编号正好相差10位(例如,受试者S1和受试者S11是双胞胎;S7和S17也是如此;等等)。(在其他两个条件中没有错误双胞胎。)
存在如此多的双胞胎——并且全部集中在一个条件中——与数据的真实性相悖。
**危险信号 #3:本应高度相关的变量完全不相关**
在研究结束时,艾瑞利和沃滕布罗奇据称“让参与者从五个方面评价他们的整体体验[校对任务]:他们有多喜欢这个任务、它有多有趣、文章质量有多好、语法质量有多好,以及文本在多大程度上有效地传达了其中包含的思想”(p. 223)。这些问题使用0到100的量表回答。复制研究者向他们的参与者提出了相同的问题。
你可能预期这些判断会相关。例如,如果有人说他们喜欢这个任务,你可能也会预期他们说这个任务很有趣。
在复制研究中,这(超级)正确。在控制实验条件的情况下,喜欢与兴趣之间的偏相关接近完全正相关,这相当合理[7 (https://datacolada.org/138#footnote_7_10014)]:
但在原始数据中,这种关系不仅不完美;而且根本不存在。说更喜欢这个任务的参与者*并未*表示他们发现任务更有趣:
总共有五项主观测量。在复制研究中,这五项测量之间的(偏)相关系数范围从+0.63到+0.92。它们都很大且非常显著(p值 < 0.0000024)。在原始数据中,这些相关系数范围从-0.29到+0.18,并且没有一个既为正又显著。这非常奇怪。
问题不限于这些主观测量。考虑人们做了三个非常相似的校对任务,每个任务有100个错误。我们当然预期在一项任务上做得更好的人,在另一项几乎相同的任务上也会做得更好。这个简单的事实应该表现为一项任务的表现与另一项任务表现之间的极高相关性。在复制数据中确实如此,相关系数范围从+0.74到+0.90。但在原始数据中并非如此,相关系数范围从+0.03到+0.27。
最后,考虑参与者被要求报告他们在每项任务上花费了多少分钟。同样,我们预期那些说在某项任务上花了更多时间的人,更可能说在另一项几乎相同的任务上花了更多时间。因此,我们预期这些变量会高度相关。再次,在复制数据中它们是——相关系数范围从+0.79到+0.95——而在原始数据中它们不是——相关系数范围从+0.05到+0.17。
本节回顾的相关性本质上只是合理性检查。喜欢与兴趣是否相关?表现与表现是否相关?报告的时间与报告的时间是否相关?正常的数据通过这些检查。异常的数据则不会。复制数据是正常的。原始数据则不然。
**危险信号 #4:自我报告时间没有取整**
正如您刚才回忆的,艾瑞利和沃滕布罗奇(2002)据称要求参与者“估计他们在每项任务上花了多少时间”(p. 223)。当人们提供这样的估计时,他们倾向于取整。他们通常说“20分钟”或“30分钟”,而不是“17分钟”或“32分钟”。事实上,当复制研究者要求人们报告他们在每项任务上花了多少分钟时,85%的人给出了整数:
这是我们预期人类会做的。
但在原始数据中,他们没有这样做。只有11.7%的估计分钟数是整数,与仅靠随机性预期的10%一致:
这不是我们预期人类会做的。
**结论**
我们无法为这里提出的所有异常现象提供一个无害的解释。原始发现效应量过大却无法复制;存在重复观测;本应很强的相关性常常不存在;本应取整的值却没有取整。基于这些证据,我们认为艾瑞利和沃滕布罗奇(2002)研究2的数据被严重篡改或伪造,以产生期望的结果。
在下一篇文章中,我们将分享对海德曼从[[email protected]](https://datacolada.org/cdn-cgi/l/email-protection)收到的Study 1数据文件的分析。那个实验非常不同。我们的分析也相当不同。但我们的结论却相当相似。
**作者反馈**
大约6周前,即2026年7月20日,我们将文章草稿分享给了原始作者(丹·艾瑞利和克劳斯·沃滕布罗奇)、复制研究作者(凯尔·海德曼和阿尔贝托·比辛)以及《心理科学》的主编(西米娜·瓦齐尔)。
**克劳斯·沃滕布罗奇**给我们发来了回复,他在回复中首先感谢海德曼和比辛进行了复制研究。他重申他从未接触过任何研究的任何数据。他区分了*对预先承诺的*需求(这是一个被海德曼和比辛复制的发现,且与他和其他人早期的工作一致)与这种预先承诺在这些特定研究中的有效性(这未能复制)。并表示他已要求编辑撤回该论文。
**丹·艾瑞利**没有回复我们发送的三封邮件中的任何一封。但在8月7日,他在LinkedIn (htm) (https://www.linkedin.com/posts/danariely_update-on-research-from-2002-more-than-two-share-7491576004428292096-WYfR)和个人网站 (htm (https://danariely.com/dan-ariely-statement-on-2002-procrastination-study/))上写道:“……最近,我了解到一篇关于截止日期和拖延症的2002年合著论文中的底层数据存在严重异常。**我目前掌握的关于这些实验的文档记录不足以回答所提出的问题,而且二十多年、数百次实验之后,我的记忆同样不足。**展望未来,我的责任在于确保准确性——更新关于这些实验的记录,并与我的合作者一起,配合最初发表我们论文的期刊,支持他们的审查和撤稿流程。”
LinkedIn和丹的网站都未允许archive.org保存副本;因此我们对两个页面进行了屏幕录制(mp4 (https://datacolada.org/wp-content/uploads/Screen-recording-Dan-Ariely-statements-about-2002-paper.mp4))。
**凯尔·海德曼**
相似文章
科学数据集中充斥着复制粘贴错误
一款旨在检测数据造假的软件工具在开放获取存储库中的科学数据集中发现了复制粘贴错误,其中包括一项高度引用的帕金森病研究,该研究发表于 Cell (2016),已在公开获取超过 8 年而未被发现。
无法复现现代论文声明 [D]
一位研究人员报告称无法复现现代论文中的声明,在检查的7项声明中,有4项无法复现,2项在GitHub上存在未解决的问题,引发了对研究质量标准的担忧。
@tunguz: 哇。这可能比可重复性危机严重得多。
一款名为 Astra 的 AI 工具被用于分析学术复现包,发现了大量代码错误,其中一些错误推翻了顶级期刊的核心结论,同时还揭示出许多模型并未被正确运行。
医学生利用热门研究工具炮制误导性研究
据报道,医学生正在使用一种热门研究工具来炮制误导性研究,引发了对学术诚信和研究质量的担忧。
FLOPs 与实际运行:AI效率评估中复现的重要性
本文复现了一项关于使用FLOPs评估AI效率的研究,验证了原始FLOPs在新硬件上不适合作为执行时间的度量,并强调了研究中完整复现包的必要性。