邓宁-克鲁格效应可能只是数据假象(2020)

Hacker News Top 新闻

摘要

一篇文章探讨了相关证据,表明邓宁-克鲁格效应可能是一种统计假象,而非真正的心理偏差,并讨论了批评意见及大卫·邓宁的回应。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 22:35

# 邓宁-克鲁格效应可能并不真实 来源:https://www.mcgill.ca/oss/article/critical-thinking/dunning-kruger-effect-probably-not-real 我希望邓宁-克鲁格效应是真实的。这个效应最初在1999年一篇开创性的论文(https://doi.apa.org/doiLanding?doi=10.1037%2F0022-3514.77.6.1121)中被描述,作者是大卫·邓宁和贾斯汀·克鲁格。它一直是记者的宠儿,用来解释为什么蠢人不知道自己蠢。甚至还有一段由《图兰朵》著名咏叹调 *Nessun dorma* 改编的精彩混搭视频(https://youtu.be/BdnH19KsVVc)来解释邓宁-克鲁格效应。“他们不知道,”歌剧演唱家在高潮部分唱道,“他们不知道。” 我原本打算写一篇关于邓宁-克鲁格效应的短文,感觉就像瓮中捉鳖一样简单。效应是什么、如何被发现、意味着什么。故事结束。 但当我仔细核对学术文献时,疑虑开始浮现。在尝试理解针对原始研究的批评时,我掉进了一个兔子洞,与几位统计学思维的人交谈,与邓宁博士本人通信,并试图弄清楚我们的大脑是否真的存在一种偏见,会高估自己在那些我们不擅长活动中的能力……还是这个著名的效应只是我们摆弄数字的奇特方式所产生的海市蜃楼。 我们是否一直高估了对邓宁-克鲁格效应的信心? ##### **一个被误解的效应** 根据邓宁博士的说法,人们对邓宁-克鲁格效应最重要的误解与其受害者是谁有关。“这个效应关乎我们,而非他们,”他写信给我说。“这个效应的教训始终是,我们应该对自己保持谦逊和谨慎。”邓宁-克鲁格效应与蠢人无关。它主要是关于我们所有人,当我们面对自己不擅长的事情时。 简而言之,邓宁-克鲁格效应最初被定义为一种思维偏见。如果我的英语语法很糟糕,并被要求做一份测试我英语语法知识的测验,根据该理论,这种思维偏见会让我相信自己会得到比实际更高的分数。而如果我擅长英语语法,该效应则规定我可能会稍微低估自己的表现。我可能预测自己会得70分,而实际得分是90%。但如果我的实际得分是15%(因为我的语法很糟糕),我可能会高估自己,预测得分为60%。这种差异就是该效应,它被认为源于我们大脑评估自身技能能力的一个特定问题。 这就是20世纪90年代末,学生参与者所经历的项目流程:测试包括语法、幽默和逻辑推理。每个人都被问及他们认为自己表现如何,同时每个人的表现也被客观评分,然后将两者进行比较。 自那时起,许多研究报道了在其他知识领域中也存在这种效应。邓宁博士告诉我,他认为这种效应“更多地与被错误信息误导有关,而非不知情。”如果问我汞的沸点,很明显我的大脑没有答案。但如果问我苏格兰的首都是什么,我可能以为自己足够了解,会回答格拉斯哥,但实际上答案是爱丁堡。这就是误导信息,它压低了我大脑中那个自信按钮。 所以,案件结案了,对吧?恰恰相反。2016年和2017年,两篇论文发表在一本名为 *Numeracy* 的数学期刊上。其中作者认为邓宁-克鲁格效应是一种海市蜃楼。而我倾向于同意。 ##### **效应存在于噪声之中** 这两篇(https://scholarcommons.usf.edu/numeracy/vol9/iss1/art4/)论文(https://scholarcommons.usf.edu/numeracy/vol10/iss1/art4/),由艾德·努弗博士及其同事撰写,他们认为邓宁-克鲁格效应可以用随机数据复制出来。“我们当时都相信[1999年]那篇论文是有效的,”努弗博士通过电子邮件告诉我。“其中的推理和论证非常有道理。我们从未打算推翻它;我们甚至是那篇论文的粉丝。”在努弗博士自己的论文中,他使用计算机生成的数据和接受科学素养测试的真实人员的结果,驳斥了大多数不熟练者没有意识到自己不熟练的说法(“只有少数人如此:我们在数据中看到大约5-6%符合这种情况”),并表明专家和新手低估和高估自己技能的频率相同。“只是专家在一个更窄的范围内这样做,”他写信给我说。 我花了数周时间才理解这一切。我招募了一对夫妻团队——帕特里克·E·麦克奈特博士(来自乔治梅森大学心理学系,同时也是“科学意识”和STATS.org的顾问委员会成员)和西蒙娜·C·麦克奈特博士(来自Global Systems Technologies, Inc.)——来帮助我理解发生了什么。帕特里克·麦克奈特不仅相信邓宁-克鲁格效应的存在:他还在教学中警告学生要留意自己实际知道什么与自己以为知道什么之间的区别。但在使用不同平台(统计计算语言R,而非努弗使用的Microsoft Excel)复制了努弗的发现后,他确信该效应只是测量方式造成的假象。 我们就此进行了长时间的对话,因为我一直在反驳。作为一个怀疑论者,我很容易被“你所知道的关于这件事的一切都是错的”这类故事所吸引。这是我的偏见。为了克服它,我不断与麦克奈特夫妇唱反调,以确保我们没有遗漏什么。每当我感到自己的理解变得清晰时,第二天疑虑又会悄悄浮现,我与麦克奈特夫妇的讨论便会重新开始。 我终于达到了一个相当确信的阶段:邓宁-克鲁格效应并未被证明是一种思维偏见,而只是一个假象。以下是我对为什么该效应看起来是真实的这一现象所拥有的最简单解释。 要让一个人类心理学效应是真实的,它就不能用随机噪声严格复制。如果人类大脑在掷硬币时倾向于选择正面,你可以将其与计算机作出的随机预测(正或反)进行比较,从而看到这种偏见。人类会比计算机更频繁地喊出正面,因为计算机是在随机下注,而人类偏向正面。但对于邓宁-克鲁格效应,情况并非如此。随机数据实际上能很好地模拟出这种效应。 最初在1999年描述的效应利用了非常特殊的一类图表。“据我所知,这种图表在大多数科学领域都相当不寻常,”帕特里克·麦克奈特告诉我。在最初的实验中,学生参加了测试并要求猜测自己的分数。因此,每个学生有两个数据点:他们认为自己得到的分数(自我评估)和他们实际得到的分数(表现)。为了可视化这些结果,邓宁和克鲁格将所有学生按四分位数分组:表现处于最低25%的人、得分处于最高25%的人,以及中间两个四分位数组。对于每个四分位数组,绘制平均表现分数和平均自我评估分数。这就得到了著名的邓宁-克鲁格图。 按这种方式绘制,看起来处于最低25%的人认为自己做得比实际好得多,而处于最高25%的人则低估了自己的表现。这种观察被认为源于人类大脑:不熟练者意识不到自己的不熟练。但如果我们将人类大脑从方程式中移除,就会得到: 上面的邓宁-克鲁格图是由帕特里克·麦克奈特使用计算机生成的自我评估和表现结果创建的。这些数字是随机的。编码中没有任何偏见会导致这些虚构学生以为自己做得很好而实际分数却很低。然而,我们可以看到这两条线与邓宁和克鲁格开创性实验中的曲线惊人地相似。在原始邓宁-克鲁格论文发表三年后,菲利普·阿克曼博士及其同事也进行过类似的模拟(https://www.sciencedirect.com/science/article/pii/S019188690100174X),结果相似。 测量一个人对任何事物的感知,包括自己的技能,充满了困难。我今天对自己测试表现的评价,如果改到明天做,可能会发生变化,因为我的情绪可能不同,自信心也可能波动。因此,这种自我评估的测量在一定程度上是不可靠的。这种不可靠性——有时巨大,有时不那么巨大——意味着任何确实存在的真正心理效应,在实验情境下都会被测量得比实际更小。这被称为由于不可靠性导致的衰减。“大量书籍、文章和章节都在强调测量误差和衰减效应的问题,”帕特里克·麦克奈特写信给我说。在他使用随机测量进行的模拟中,所谓的邓宁-克鲁格效应实际上随着测量误差的增加而变得更加*明显*。“在科学发现的历史上,我们没有任何先例表明一个发现会因增加测量误差而变得更好。一个都没有。” ##### **打破魔咒** 当我在谷歌新闻中搜索“邓宁-克鲁格效应”时,我得到了来自 *纽约时报*、*新科学家* 和CBC等媒体的超过8500条结果。如此多的报道只是简单地将该效应视为大脑的一种真实偏见,难怪人们不了解自该效应首次发表以来一直存在的学术批评。不仅仅是努弗博士和他的 *Numeracy* 论文。其他学术批评者也指出了问题,例如向均值回归。 但正如帕特里克·麦克奈特指出的那样,向均值回归发生在对同一测量随时间追踪其演变时。如果我每天早上量体温,某天发烧了,那么同样的测量值(希望)第二天会下降,随着退烧而回到均值。这就是向均值回归。但在邓宁-克鲁格效应的背景下,没有任何东西随时间测量,而且自我评估和表现是完全不同的测量,因此向均值回归不应适用。然而,自我评估测量本身的不可靠性,是一个强有力的竞争者,可以解释邓宁、克鲁格以及其他后来在其他情境中报告过该效应的科学家所描述的内容中的很大一部分。 这个故事还没有结束。关于这个问题的讨论无疑还会在学术期刊上继续,这毕竟是科学研究中健康的一部分。研究质子和电子相对容易,因为这些粒子没有自己的思想;相比之下,研究人类心理学要困难得多,因为需要同时处理的变量数量极其庞大。因此,心理学研究结果很容易看起来是真实的,而实际上并非如此。 有没有愚蠢的人却意识不到自己愚蠢?当然有,但这从来不是邓宁-克鲁格效应的重点。有没有人对自己的无知非常自信和傲慢?绝对有,但同样,邓宁和克鲁格在1999年并未测量自信或傲慢。心理学家还知道其他效应,比如过度自信偏差和优于平均效应(大多数汽车司机认为自己远高于平均水平(https://www.psychologicalscience.org/news/motr/when-it-comes-to-driving-most-people-think-their-skills-are-above-average.html),这在数学上毫无意义),所以即使邓宁-克鲁格效应被令人信服地证明只是海市蜃楼,也不意味着人类大脑无懈可击。如果研究人员在面临重大批评时仍继续相信该效应,这并非邓宁-克鲁格效应的悖论式例证。在最初的经典实验中,学生在进行自我评估时没有收到任何反馈。可以公平地说,研究人员现在的处境不同了。 “邓宁-克鲁格效应”这几个字多年来一直被记者和怀疑论者当作咒语,用来解释愚蠢和无能。也许是时候打破这个魔咒了。 **要点总结:** - 邓宁-克鲁格效应最初于1999年被描述为一种现象:在某项任务上表现极差的人认为自己比实际好得多,而表现非常好的人则倾向于低估自己的能力 - 邓宁-克鲁格效应从来不是关于“蠢人不知道自己蠢”,也不是关于“无知的人对自己的无知非常傲慢和自信” - 因为该效应可以在随机的、计算机生成的数据中看到,它可能并非我们思维中的真实缺陷,因此可能并不真正存在 --- @CrackedScience(http://twitter.com/crackedscience) *留下评论!*(https://www.facebook.com/McGillOSS/posts/3588452611194168)

相似文章

AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。

AI幻觉可能比人类更“人性”

Reddit r/artificial

文章指出,AI幻觉其实映射了人类的认知偏差——确认偏误、过度自信等,它们并非纯粹的技术缺陷,而是像人类一样在知识缺口处“脑补”的结果。

AI科学家产出结果却未进行科学推理[R]

Reddit r/MachineLearning

一项对25,000次AI科学家试验的研究发现,智能体68%的时间忽视证据,极少修正假设,显示流行的脚手架修复方法并未赋予真正的科学推理能力。