El efecto Dunning-Kruger es autocorrelación
Los críticos del famoso efecto Dunning–Kruger sostienen que gran parte de su patrón característico —personas poco competentes sobrestimando su capacidad y expertos subestimándola— puede surgir puramente de artefactos estadísticos como la regresión a la media, las puntuaciones acotadas y la forma en que se grafican los datos. Otros responden que, incluso teniendo en cuenta estos efectos, los estudios siguen mostrando un sesgo psicológico real, aunque menor: la gente tiende a valorarse por encima de la media, y la precisión de la autoevaluación mejora solo débilmente con la habilidad real. El intercambio pone de relieve preocupaciones más amplias sobre métodos frágiles en ciencias sociales, la brecha entre los hallazgos originales de Dunning–Kruger y su versión de la cultura popular, y lo dispuesta que está mucha gente a usar el efecto para explicar la incompetencia percibida en otros.
Alcance del efecto Dunning–Kruger (DK)
- Varios comentaristas señalan una brecha entre el hallazgo original de DK y el meme de divulgación científica.
- Resultados originales:
- La capacidad autoevaluada se correlaciona positivamente (no negativamente) con la capacidad real, pero débilmente.
- Las estimaciones de todos están sesgadas al alza (alrededor del ~65.º percentil).
- Los de peor desempeño sobreestiman más; los de mejor desempeño subestiman algo; el sesgo regresa hacia un punto ligeramente por encima de la media.
- La versión popular (“los idiotas creen que son genios, los expertos creen que son idiotas”) se considera ampliamente una distorsión.
Crítica de autocorrelación / regresión a la media
- El artículo enlazado simula rendimiento y autoevaluación aleatorios e independientes.
- Cuando se representa como “rendimiento real vs (autoevaluación - rendimiento real)”, esto produce automáticamente un patrón similar al de DK: los que obtienen bajas puntuaciones sobreestiman, los de altas puntuaciones subestiman.
- Muchos sostienen que esto es simplemente regresión a la media / puntuaciones acotadas, no “autocorrelación” en el sentido estándar de series temporales.
- Punto: si datos aleatorios producen la misma forma, entonces ese gráfico concreto es una mala prueba para un efecto psicológico.
Réplicas al argumento de la simulación
- Otros responden que en la vida real el rendimiento y la autoevaluación no se espera que sean independientes; un modelo nulo de pura aleatoriedad es poco realista.
- Señalan diferencias entre los datos de DK y la simulación aleatoria:
- Las autoestimaciones reales tienden a subir con la capacidad (línea no plana).
- Las estimaciones reales se agrupan por encima del percentil 50, a diferencia de las conjeturas aleatorias uniformes.
- Por lo tanto, ven evidencia de:
- Exceso de confianza sistemático, y
- Mejora de la autoevaluación con mayor habilidad, aunque el tamaño del efecto es pequeño.
Preocupaciones metodológicas y estadísticas sobre DK
- Críticas planteadas en el hilo:
- El uso de percentiles acotados (efectos de techo/suelo) y el “double dipping” (usar la puntuación del test tanto para agrupar como para el error) pueden fabricar la curva de DK.
- La falta de varianza/barras de error en los gráficos originales oculta si los grupos realmente difieren.
- Las tareas incluyen medidas subjetivas (por ejemplo, humor); la muestra es pequeña, homogénea (estudiantes de Cornell que buscan crédito extra).
- Intentos de replicación y artículos de modelado posteriores sugieren que gran parte del gráfico canónico de DK puede surgir del ruido más los límites, con solo un efecto residual mínimo.
Estado, replicación y percepción
- Algunos comentaristas afirman que DK ha sido “refutado” (o muy matizado) en varios artículos posteriores; otros dicen que las refutaciones ellas mismas malinterpretan la estadística.
- Un metaanálisis reciente (citado en el hilo) al parecer encuentra un efecto DK real pero muy pequeño, lo que pone en duda su importancia práctica.
- Varios señalan el atractivo social/psicológico de DK como forma de etiquetar a otros como “idiotas confiados”, lo que quizá explique su persistencia pese a la controversia metodológica.