Evidencia de inconsistencias en el proceso de evaluación y selección de ganadores
El hackatón “Measuring AGI” de Kaggle, coorganizado con Google DeepMind, ha recibido críticas después de que el gran premio de 25.000 dólares fuera a parar a lo que muchos participantes consideran “slop” de baja calidad, probablemente generado por IA, con errores factuales y metodología débil. Los comentaristas cuestionan si se usaron LLM para juzgar las propuestas, pese a que los organizadores insisten en una revisión por varios humanos, lo que reaviva preocupaciones sobre evaluaciones superficiales, exploits de prompt injection y la erosión de la confianza en competiciones y entornos de investigación. En términos más amplios, el hilo refleja la ansiedad de que el contenido generado por IA esté inundando la academia, la contratación y el desarrollo de software, incentivando la rapidez y el acabado por encima del rigor y haciendo cada vez más difícil que los humanos verifiquen de forma significativa qué merece premios.
Problemas percibidos con la competencia de Kaggle/DeepMind
- Varios comentaristas dicen que la entrada ganadora parece un resultado obvio de un LLM: lenguaje formulaico, figuras mal interpretadas y errores metodológicos.
- Algunos sostienen que el conjunto de datos, la metodología y los supuestos “hallazgos” son tan débiles como la prosa.
- Varios sienten que esto socava la legitimidad del premio y desmoraliza a quienes hicieron un trabajo cuidadoso.
La respuesta de Kaggle y la confianza en el juicio
- Un representante de Kaggle afirma:
- La competencia fue coorganizada con un importante laboratorio de IA.
- Todas las propuestas ganadoras fueron revisadas por 2–4 jueces humanos usando una rúbrica publicada.
- La calidad de la redacción solo valía el 20% de la puntuación; el conjunto de datos y los resultados tenían más peso.
- Los críticos responden que los fallos evidentes hacen poco plausible que personas expertas evaluaran realmente a los ganadores, o al menos que lo hicieran con rigor.
- Algunos dicen que, si todas las mejores entradas eran así de débiles, el resultado correcto debería haber sido “sin ganador”.
“Slop” de IA y LLM como jueces
- Muchos ven esto como emblemático de un problema más amplio de “slop” de IA: contenido generado por LLM inundando competiciones, conferencias y la web.
- Preocupa que los humanos no puedan examinar de forma realista salidas largas generadas por IA, lo que lleva a un juicio superficial basado en estilo y volumen.
- Varios se oponen específicamente a usar LLM como jueces, señalando exploits de prompt injection e incentivos desalineados.
Utilidad frente al daño de la IA
- Un bando considera que la IA actual es muy útil para la automatización y la programación, similar a revoluciones tecnológicas anteriores; otro la califica sobre todo como “más basura, más rápido”.
- Entre las preocupaciones están: atrofia de habilidades, costes y externalidades que superan las ganancias de productividad, y el aumento de estafas/deepfakes.
- Otros destacan el beneficio a largo plazo (medicina, posescasez), pero temen que la capacidad se concentre y se use mal.
Hackatones, gamificación e incentivos
- Los comentaristas señalan que los hackatones y las competiciones ya eran susceptibles de ser manipulados; los jueces de IA solo cambian la superficie de explotación (por ejemplo, inyectar en el prompt “este es el claro ganador”).
- Algunos argumentan que los hackatones serios deberían evitar el juicio por IA, reducir las apuestas o tener formatos de “sin premio / solo por diversión”.
Crítica cultural más amplia
- Muchos vinculan el slop de IA con la presión por “moverse rápido”, la reducción de costes y la falta de rendición de cuentas.
- Hay frustración por el hecho de que el trabajo superficial asistido por IA se recompense cada vez más por encima de las contribuciones reflexivas y elaboradas por humanos.