邓宁-克鲁格效应是自相关
对著名的邓宁–克鲁格效应的批评认为,其标志性模式——能力不足的人高估自己、专家低估自己——很大程度上可能只是统计伪影造成的,例如均值回归、有界测试分数,以及数据绘图方式。另一些人则反驳说,即使考虑了这些因素,研究仍显示出一种真实但更小的心理偏差:人们往往把自己评得高于平均水平,而自我评估的准确性只会随着实际技能略有提升。整场争论凸显了社会科学中脆弱的方法论、原始邓宁–克鲁格发现与其流行文化版本之间的差距,以及人们多么乐于用这一效应去解释他人的无能。
邓宁–克鲁格(DK)效应的范围
- 几位评论者指出,原始 DK 发现与流行科学中的梗图之间存在差距。
- 原始结果:
- 自我评估能力与实际能力呈正相关(而非负相关),但相关性很弱。
- 所有人的估计都存在向上偏差(大约在第 ~65 百分位)。
- 表现较差的人高估更多;表现较好的人则会略微低估;偏差向一个略高于平均值的点回归。
- 流行版本(“笨蛋以为自己是天才,专家以为自己很蠢”)被广泛视为一种歪曲。
对自相关 / 均值回归的批评
- 链接文章模拟了随机、彼此独立的表现和自我评估。
- 当把它画成“实际表现 vs(自我估计 – 实际表现)”时,会自动得到一种类似 DK 的模式:低分者高估,高分者低估。
- 许多人认为这只是均值回归 / 有界分数的结果,而不是时间序列意义上的“自相关”。
- 重点在于:如果随机数据都能产生相同的形状,那么这种特定图形就不是检验心理效应的好方法。
对模拟论点的反驳
- 也有人反驳说,在现实生活中,表现和自我评估并不应当彼此独立;纯随机的零假设并不现实。
- 他们指出 DK 数据与随机模拟之间的差异:
- 现实中的自我估计会随着能力提高而上升(不是平直线)。
- 现实中的估计集中在第 50 百分位以上,不像均匀随机猜测那样。
- 因此,他们认为存在以下证据:
- 系统性的过度自信;以及
- 随着技能提高,自我评估也会改善,不过效应量很小。
关于 DK 的方法学与统计学问题
- 线程中提出的批评包括:
- 使用有界百分位数(天花板/地板效应)以及“双重使用”(用测试分数既用于分组又用于误差)会制造出 DK 曲线。
- 原始图中缺少方差/误差条,使得各组是否真的不同并不清楚。
- 任务包含主观测量(例如幽默感);样本很小、同质性高(寻求额外学分的 Cornell 本科生)。
- 复制尝试和后来的建模论文表明,经典 DK 图的大部分都可能来自噪声加边界效应,而只剩下极小的残余效应。
状态、复制与认知
- 一些评论者声称,DK 已在多篇后续论文中被“证伪”(或被大幅限定);另一些人则认为这些反驳本身误解了统计学。
- 线程中引用的一项较新的元分析据称发现了真实但非常小的 DK 效应,这也让其实际意义受到质疑。
- 还有几位指出,DK 在社会与心理层面的吸引力在于,它提供了一种把别人标记为“自信的笨蛋”的方式,这或许解释了它尽管存在方法学争议却仍然流行的原因。