科学数据集中充斥着复制粘贴错误
摘要
一款旨在检测数据造假的软件工具在开放获取存储库中的科学数据集中发现了复制粘贴错误,其中包括一项高度引用的帕金森病研究,该研究发表于 Cell (2016),已在公开获取超过 8 年而未被发现。
暂无内容
查看缓存全文
缓存时间: 2026/04/20 14:44
# 科学数据集充斥复制粘贴错误
来源: https://www.sciencedetective.org/scientific-datasets-are-riddled-with-copy-paste-errors/
以上数据来自帕金森病研究的一篇里程碑式论文,该论文首次提供证据表明该疾病源于肠道而非大脑。该论文获得了主要媒体的报道 (https://www.bbc.com/news/health-38173287?ref=sciencedetective.org),已被其他科学论文引用超过 3000 次。但底层数据包含重复的数值序列,这些数值本应属于完全不同的个体小鼠。该数据集已在 Dryad (https://datadryad.org/dataset/doi:10.5061/dryad.4mp6h?ref=sciencedetective.org) 这个开放获取数据库公开可用超过 8 年,科学家在此上传他们的原始数据。为什么直到现在才有人注意到这些明显的复制粘贴错误?
在深入探讨这个案例之前,让我介绍一下我们是如何发现这个问题的:这是由一款软件 (https://github.com/markusenglund/copy-paste-detective?ref=sciencedetective.org) 标记的,我从去年开始构建这个软件,灵感来自近几年引起轰动的两起数据造假案例。一起涉及诺贝尔奖获得者托马斯·苏德霍夫的实验室 (https://forbetterscience.com/2023/10/04/thomas-sudhof-and-the-standards-of-scientific-rigor/?ref=sciencedetective.org),另一起涉及蛛类生态学家乔纳森·普鲁特 (https://laskowskilab.faculty.ucdavis.edu/2020/01/29/retractions/?ref=sciencedetective.org)。这两起案例都有公开可用的数据集,其中整个数据块被复制粘贴,看起来相当容易被发现。我很想知道通过创建一个能正确标记这些案例的程序,然后在开放获取数据库中的所有数据集上运行它,能挖掘出什么。
与一些志愿贡献者合作,我们已完成对前 600 个数据集的报告工作。我们发现了 18 起严重到值得关注的案例。以下是其中 3 个最有趣的案例:
## 案例 1:帕金森病的开创性论文
- 文章:《肠道微生物调节帕金森病模型中的运动缺陷和神经炎症》(https://doi.org/https://doi.org/10.1016/j.cell.2016.11.018?ref=sciencedetective.org) *Cell*(2016)
- Dryad 数据集 (https://doi.org/doi:10.5061/dryad.4mp6h?ref=sciencedetective.org) | Pubpeer 评论 (https://pubpeer.com/publications/765CBDC8E738AC8FD5CF0B1A2F6A2E?ref=sciencedetective.org#15)(由贡献者 Ben Woden 提供)
> 我们取了一些在遗传上易患帕金森症症状的小鼠,清除了它们的微生物组——所有症状都消失了。
这是该论文的资深作者萨基斯·马兹曼尼在 Rich Roll YouTube 频道上总结该研究发现时的说法:
这些是他所指的结果:
来源:图 4 (https://www.sciencedirect.com/science/article/pii/S0092867416315902?ref=sciencedetective.org)
图 B、C 和 D 包含不同小鼠群体运动功能的测量结果。它们讲述了一个清晰的故事:ASO 小鼠(在遗传上易患小鼠帕金森病模型)完成任务所需的时间比正常野生型(WT)小鼠更长,**仅当**它们保留了正常肠道微生物组(*SPF、**Ex-GF***)时——在被剥除微生物组的小鼠(*GF、**Abx***)中则不然。
显示哪些结果受每个重复值块影响的图表。数据存在两个问题:
1. "粘合剂移除时间"列中有两组 5 个相同的连续数字,在 SPF 小鼠(用正常健康微生物组饲养)和 ExGF 小鼠(用剥除的微生物组饲养,但随后用肠道重新定植)之间共享。
2. 在无菌野生型小鼠的"杆下降时间"数据中有一对包含 3 个相同数字的序列。
**结论**
这可能是编辑 Excel 文件时的笔误,也可能是故意篡改以掩盖没有讲述正确故事的真实数据。
该研究样本量较小,即使我们相信其余数据,对论文结论的影响也很严重。重复的行占 SPF 样本的 50% 和 ExGF 样本的 42%。虽然运动功能值并不是作者依赖的唯一数据来支持他们的结论,但它们对于证明肠道细菌实际上导致帕金森样症状是必要的。
该问题在 1 月被报告,至今作者尚未回应。
## 案例 2:鸵鸟蛇类混淆
- 文章:《毒素耐受性Na,K-ATP酶进化约束对序列差异的依赖性有限》(https://doi.org/https://doi.org/10.1371/journal.pgen.1010323?ref=sciencedetective.org) *PLOS Genetics*(2022)
- Dryad 数据集 (https://doi.org/doi:10.5061/dryad.sqv9s4n68?ref=sciencedetective.org) | Pubpeer 评论 (https://pubpeer.com/publications/5088E45EA0034E051FB767BD3A346F?ref=sciencedetective.org)
在这篇论文中,作者研究了不同动物如何进化出对强心苷(CTS)这类毒素的耐受性。自然界中存在一场军备竞赛,猎物物种产生 CTS 来保护自己免受鸟类和蛇类等动物的捕食,这些捕食者反过来进化出突变以帮助保护自己免受毒素伤害。
作者创造了乌巴因(一种 CTS)和 Na,K-ATP 酶(毒素的靶蛋白)的混合物,以获得剂量-反应曲线,显示该蛋白的不同版本在各种剂量下对毒素的耐受程度。
**问题**
来源:NKA_Enzyme_Assays_Raw_Data.xlsx (https://datadryad.org/dataset/doi:10.5061/dryad.sqv9s4n68?ref=sciencedetective.org),工作表:"IC50"
黄色单元格是鸵鸟/沙鸡数据和游蛇属数据(一种蛇)之间的精确副本。更令人担忧的是橙色单元格,这些是近似副本,相差一或两位数字,总是以相同数字结尾。例如,第 39 行的 0.538 变成第 71 行的 0.518。在 8 个非重复对中,有 6 个这样的对。
在她的回应 (https://pubpeer.com/publications/5088E45EA0034E051FB767BD3A346F?ref=sciencedetective.org#2) 中,第一作者沙巴姆·穆罕默迪承认这可能是复制粘贴错误。对于可疑的橙色单元格,她给出了以下解释:
> 我们怀疑它们[标记为橙色的单位数字调整的单元格]源于同一平板多次读取的测量变化,鸵鸟和游蛇属的结果是从同一平板的不同读取中复制的。但是,由于原始阅读器输出不可用,我们无法确认这是变化的来源。
**结论**
一位数字的微调是否可能由作者理论化的同一平板的多次读取导致?我最好的猜测是否定的,但有足够的不确定性让我暂停。
在对同一平板进行多次读取时,我们通常预期许多值会有很小的波动。相反,我们看到几乎所有值都保持完全相同,除了 8 个值变化很大。在电子邮件通信中,作者为此提供了一个可能的解释:在进行读取之前,他们添加一种化学物质来停止反应,这应该会稳定数值。但某些孔会比其他孔稳定得更快,这可以解释为什么这 8 个值仍有如此大的变化。
这仍然留下了 6 对数值各自恰好以相同数字结尾的问题。这纯粹偶然发生的可能性极其微小。
BioRad Model 680 是一台基础仪器,记录它看到的原始光测量而无需任何后处理,但也许仍然可能它会引入某种偏差,使读数更可能以相同数字结尾。
另一种解释是作者要么不小心要么故意地将鸵鸟/沙鸡数据复制粘贴到游蛇属数据上。然后他们可能手动篡改数据以更好地适应他们的假设或使其看起来不那么可疑,没有意识到复制粘贴会留下这个签名。然而,欺诈理论因为没有明显的理由说明作者为什么要篡改这些特定数值而受到削弱。
作者表示他们将尝试复制该过程并在 Pubpeer 上报告他们的发现。
**请在 [这里](https://www.sciencedetective.org/scientific-datasets-are-riddled-with-copy-paste-errors/#update-response-to-the-author-of-case-2) 查看作者的回应。**
## 案例 3:混乱的鱼类尺寸
- 文章:《无性系鱼类中的行为个体性尽管饲养条件几乎相同而仍然出现》(https://doi.org/https://doi.org/10.1038/ncomms15361?ref=sciencedetective.org) *Nature Communications*(2017)
- Dryad 数据集 (https://doi.org/doi:10.5061/dryad.td3sj?ref=sciencedetective.org) | Pubpeer 评论 (https://pubpeer.com/publications/D1769F3E32035DFA98B422B27F8C86?ref=sciencedetective.org)(由贡献者 Ben Woden 提供)
**背景**
这是一篇 2017 年关于鱼类个性的论文。他们拿了一群在遗传上相同的鱼,然后检查它们的游泳行为在距离上的变化幅度有多大。目的是在保持遗传和环境相同的情况下,了解它们的行为差异有多大。除了运动外,他们还考虑了每条鱼的大小,以检查运动中的任何差异是否仅仅是由于大鱼运动方式不同于小鱼。
**问题**
SL 列是以毫米为单位测量的各个鱼类的长度。你能发现有什么看起来不合适的地方吗?
3 条不同的个体鱼(ID 5、8 和 10)都具有完全相同的连续尺寸测量,这看起来非常奇怪。但是等等,一条个体鱼在几天内真的会短超过 10% 吗?他们真的测量了每条个体鱼的长度 4 次吗?没有。
**结论**
如果我们按 SL 列对工作表进行排序,真实的解释就变得显而易见。它揭示了每个唯一的 SL 值恰好重复出现 4 次。4 也恰好是对每条个体鱼进行的观察次数。
相同的电子表格按 SL(鱼长,单位毫米)排序
原因是作者只测量了一次鱼的长度。所以同一条鱼的所有 4 行观察本应具有完全相同的鱼长,但它们已被混乱,以至于一条鱼的长度被分配给了 4 条其他鱼。
在他的回应 (https://pubpeer.com/publications/D1769F3E32035DFA98B422B27F8C86?ref=sciencedetective.org#5) 中,第一作者承认了该错误并给出了以下解释:
> 简而言之,我们在两个单独的数据文件中存储了测量的体型和行为,当我们合并这些文件时,我们意外地错位了 ID 值,导致相位偏移,所有体型值都被移位并分配给了错误的行
我没有理由怀疑他。
在论文中,他们毫不奇怪地得出了体型对距离运动没有任何影响的结论,而在他们的更正分析 (https://datadryad.org/downloads/file_stream/4591033?ref=sciencedetective.org) 中,他们确实发现了一个小的影响:
> 体型现在是行为的显著预测因子,但其影响相当小(即 1mm 的体长增加导致整个试验中游泳总距离减少 0.8cm),实际上大约是观察效应的 3 分之一。更重要的是,体型仍然不能解释鱼之间行为的差异。
看起来作者在承认和纠正他们的错误方面做得很好。幸运的是,体型只能解释鱼之间行为差异的一小部分。"结论保持不变"是你从研究人员那里听到的一句话,永远不应该想当然,但在这个案例中,似乎是对的。
## 目前的总体结果
该软件在前 600 个数据集中检测到 18 起严重到值得关注的案例。到目前为止,我们已在 PubPeer 上发布了其中 15 起([完整列表见此](https://www.sciencedetective.org/about))。它们中大多数可能是无辜的错误,有些可能是故意造假。其中一起 (https://www.science.org/doi/10.1126/science.aag2792?ref=sciencedetective.org) 已被撤回。所以基于该有限样本,大约 3% 的论文包含这些类型的错误。
然而,真实的错误率肯定远高于 3%。还有许多其他方式可能会意外破坏你的数据,这个软件永远无法检测到。如果你想犯欺诈罪,有许多比从同一个 Excel 工作表的不同部分复制粘贴数值更不懒的方式。
对一些人来说,没有其他人关心检查这些错误可能令人惊讶。不是应该有什么同行评审的东西来防止这样的东西进入科学记录吗?我得出的结论是,根本没有人的工作是主动寻找它。期刊、大学和资助机构不会雇人来做这件事,因为他们通常更关心排名和指标。如果你向他们报告一个严重的错误,你只是引入了一个令人讨厌的不便,可能会让这些数字向错误的方向发展。
唯一的亮点是 Dryad (https://datadryad.org/?ref=sciencedetective.org)——研究数据库。他们通过帮助推动期刊和作者纠正记录,在支持该项目方面发挥了积极作用。
## 接下来是什么
我去年开始从事这个项目,取得了一些好的初步结果后,我能够从 Astral Codex Ten (https://www.astralcodexten.com/p/acx-grants-results-2025?ref=sciencedetective.org#:~:text=and%20other%20pests.-,Markus%20Englund,-%2C%20%2450K%2C%20for%20software)(一个受欢迎的科学博客)筹集到 50,000 美元的资助,这让我能够辞职并在今年全职从事这项工作。接下来是扫描 Dryad 上可用的其余约 24,000 个包含 Excel 文件的数据集。看看我们还能在那里挖掘到什么其他宝藏会很有趣!如果 3% 的错误率保持不变,我们预计仅在该样本中就会看到约 700 起更多的案例。欢迎订阅电子邮件通讯以随时了解我们的发现。
*2025 年 3 月 8 日更新:删除了案例 2 的裁决中不必要的自信,并添加了一些额外的细节。*
*2025 年 3 月 23 日更新:澄清 18 起案例中的 15 起已在 Pubpeer 上公开发布。*
## 更新:案例 2 作者的回应
*2025 年 4 月 11 日添加。*
该论文的第一作者沙巴姆·穆罕默迪在评论部分回应了。我在这里将其与我的回应一起添加。
### 穆罕默迪的回应
> 作为这项研究的第二个案例的作者和所涉及实验的执行者,我想提供一些额外的背景。
> 如所述,Model 680 平板阅读器是一台 30 年历史的旧版平板阅读器,需要手动转换或复制粘贴结果。英隆德关于 Model 680"记录它看到的原始光测量而无需任何后处理"的说法是不正确的。该仪器的分辨率为 0.001 OD,在 0.000-2.000 OD 范围内的指定可重复性为 1.0% 或 0.005 OD(在 2.000-3.000 OD 范围内为 1.5%)。它使用比尔定律将模拟强度信号转换为吸光度值,并将结果四舍五入到最近的 0.001 OD。因此,在狭窄范围内波动的值可能以产生表观数字级别模式的方式四舍五入,某些数字在井之间变化系统地变化,而其他数字看起来不变。对于发展中的比色测定,一混合...
相似文章
OpenBioRQ:AI代理有15.9%的概率引用错误论文
一项新的基准论文OpenBioRQ揭示,AI代理很少捏造引用,但常常引用不支持其主张的论文,在生物医学语境中有15.9%的引用不匹配。
研究人员刚刚在医学论文中发现28个虚假AI引用
研究人员在影响临床指南的医学论文中发现了28个AI生成的虚假引用,凸显了AI幻觉破坏科学诚信和患者护理的风险。
医学生利用热门研究工具炮制误导性研究
据报道,医学生正在使用一种热门研究工具来炮制误导性研究,引发了对学术诚信和研究质量的担忧。
有多少已发表的AI研究因数据泄露而错误?
普林斯顿大学的一项研究发现,在17个领域的近300篇AI论文中存在数据泄露问题,导致结果过于乐观。作者强调了意外泄露数据的容易程度,并提醒不要轻信那些令人印象深刻的AI声明而不检查是否存在泄露。
无法复现现代论文声明 [D]
一位研究人员报告称无法复现现代论文中的声明,在检查的7项声明中,有4项无法复现,2项在GitHub上存在未解决的问题,引发了对研究质量标准的担忧。