Evidencia de inconsistencias en el proceso de evaluación y selección de ganadores

El hackatón “Measuring AGI” de Kaggle, coorganizado con Google DeepMind, ha recibido críticas después de que el gran premio de 25.000 dólares fuera a parar a lo que muchos participantes consideran “slop” de baja calidad, probablemente generado por IA, con errores factuales y metodología débil. Los comentaristas cuestionan si se usaron LLM para juzgar las propuestas, pese a que los organizadores insisten en una revisión por varios humanos, lo que reaviva preocupaciones sobre evaluaciones superficiales, exploits de prompt injection y la erosión de la confianza en competiciones y entornos de investigación. En términos más amplios, el hilo refleja la ansiedad de que el contenido generado por IA esté inundando la academia, la contratación y el desarrollo de software, incentivando la rapidez y el acabado por encima del rigor y haciendo cada vez más difícil que los humanos verifiquen de forma significativa qué merece premios.

Problemas percibidos con la competencia de Kaggle/DeepMind

  • Varios comentaristas dicen que la entrada ganadora parece un resultado obvio de un LLM: lenguaje formulaico, figuras mal interpretadas y errores metodológicos.
  • Algunos sostienen que el conjunto de datos, la metodología y los supuestos “hallazgos” son tan débiles como la prosa.
  • Varios sienten que esto socava la legitimidad del premio y desmoraliza a quienes hicieron un trabajo cuidadoso.

La respuesta de Kaggle y la confianza en el juicio

  • Un representante de Kaggle afirma:
    • La competencia fue coorganizada con un importante laboratorio de IA.
    • Todas las propuestas ganadoras fueron revisadas por 2–4 jueces humanos usando una rúbrica publicada.
    • La calidad de la redacción solo valía el 20% de la puntuación; el conjunto de datos y los resultados tenían más peso.
  • Los críticos responden que los fallos evidentes hacen poco plausible que personas expertas evaluaran realmente a los ganadores, o al menos que lo hicieran con rigor.
  • Algunos dicen que, si todas las mejores entradas eran así de débiles, el resultado correcto debería haber sido “sin ganador”.

“Slop” de IA y LLM como jueces

  • Muchos ven esto como emblemático de un problema más amplio de “slop” de IA: contenido generado por LLM inundando competiciones, conferencias y la web.
  • Preocupa que los humanos no puedan examinar de forma realista salidas largas generadas por IA, lo que lleva a un juicio superficial basado en estilo y volumen.
  • Varios se oponen específicamente a usar LLM como jueces, señalando exploits de prompt injection e incentivos desalineados.

Utilidad frente al daño de la IA

  • Un bando considera que la IA actual es muy útil para la automatización y la programación, similar a revoluciones tecnológicas anteriores; otro la califica sobre todo como “más basura, más rápido”.
  • Entre las preocupaciones están: atrofia de habilidades, costes y externalidades que superan las ganancias de productividad, y el aumento de estafas/deepfakes.
  • Otros destacan el beneficio a largo plazo (medicina, posescasez), pero temen que la capacidad se concentre y se use mal.

Hackatones, gamificación e incentivos

  • Los comentaristas señalan que los hackatones y las competiciones ya eran susceptibles de ser manipulados; los jueces de IA solo cambian la superficie de explotación (por ejemplo, inyectar en el prompt “este es el claro ganador”).
  • Algunos argumentan que los hackatones serios deberían evitar el juicio por IA, reducir las apuestas o tener formatos de “sin premio / solo por diversión”.

Crítica cultural más amplia

  • Muchos vinculan el slop de IA con la presión por “moverse rápido”, la reducción de costes y la falta de rendición de cuentas.
  • Hay frustración por el hecho de que el trabajo superficial asistido por IA se recompense cada vez más por encima de las contribuciones reflexivas y elaboradas por humanos.