Dunning-Kruger 效应可能只是一个数据伪影(2020)

一篇认为著名的 Dunning–Kruger 效应可能只是统计伪影、而非真实心理现象的说法,引发了对原始研究设计与分析方式的审视。评论者剖析了自相关、天花板效应和带偏的模拟等问题,同时将细腻的学术结论(“每个人都会失准,但新手失准范围更大”)与流行迷思(“白痴不知道自己是白痴”)区分开来。尽管许多人仍凭自身经验相信“无能却自信”很常见,但也承认心理学的可重复性问题和薄弱方法,使得我们很难判断这种效应究竟有多强、又有多特殊。

对“伪影”说法的统计学批评

  • 一些评论者认为这篇文章写得空泛且解释不足,尤其是在“随机”模拟是如何生成的这点上。
  • 另一些人深入查看了共享代码,并指出其中存在问题:四分位 t 检验似乎是错误地复制粘贴的,随机线条只按正斜率和偏差进行采样,而且还人为施加了一个正相关(例如 r=0.19),这在某种程度上预先“写入”了这种效应。
  • 还有人认为,模拟图与原始图看起来相似的事实只是薄弱证据:“两张图看起来像” ≠ “因此原结果毫无意义。”
  • 也有人指出了自相关以及天花板/地板效应:当自我评分带有噪声并被限制在 0–100 之间时,低表现者向下高估的空间只能这么多,而高表现者向上高估的空间也只能这么多,即使在有噪声的情况下,也会产生典型的“X”形或“U”形曲线。

对原始 Dunning–Kruger 研究结果的解释

  • 多位评论者强调,原始结果其实很温和:低表现者认为自己做得稍好一些(例如 F ≈ D),而高表现者则略微低估自己(A ≈ B),并不是“白痴以为自己是天才”。
  • 有人指出,后续分析报告称专家和新手高估与低估的频率相近;专家只是这种偏差分布范围更窄,这意味着校准更好。
  • 还有人强调,当你按四分位和相对排名做平均时,结构性偏差即使在个体自评基本随机的情况下也能生成那张图。

口语化 vs 科学化的 DK,以及相关概念

  • 许多人认为这里存在分裂:
    • 科学意义上的 DK(关于“多数”低表现者的强断言)在重新分析下显得脆弱。
    • 口语化的 DK(“有些人在无能时会极度自信”)明显符合日常观察。
  • 讨论中还提到了相关现象:冒名顶替综合征、“工程师病”/ultracrepidarianism(专家越界到其他领域)、虚假共识效应,以及经典的“你不知道自己不知道什么”的能力阶段。

可重复性危机与对心理学的怀疑

  • 一些参与者把 DK 视为更广泛可重复性危机中的又一个例子;他们质疑心理学的很大一部分是否算得上严谨科学。
  • 也有人反驳:软性领域本来就更难测量;重复失败并不自动否定所有效应,只能说明方法薄弱。

轶事、直觉与元讽刺

  • 许多人基于管理和技术经验坚持认为 DK “一定”是真的;也有人警告说这其实是确认偏误。
  • 讨论中反复出现一种元评论:在不了解统计学的情况下自信地误用或“辟谣” DK,本身就是 DK 的一个例子。