ChatGPT genera un conjunto de datos falso para respaldar una hipótesis científica

Los modelos de lenguaje como GPT‑4 ahora pueden generar conjuntos de datos científicos de aspecto realista que parecen respaldar una hipótesis elegida, lo que plantea preocupaciones sobre lo fácil que podría ser fabricar evidencia para artículos. Los comentaristas señalan que el fraude de datos y el p-hacking existen desde mucho antes de la IA, pero sostienen que automatizar la falsificación plausible podría amplificar los problemas para la revisión por pares, las fábricas de papers y los esfuerzos de replicación, ya ya debilitados. Otros señalan que los datos sintéticos también tienen usos legítimos y ven el problema central como unos incentivos académicos rotos y una verificación débil, no las herramientas en sí.

Alcance de la discusión

  • El hilo se centra menos en las “alucinaciones” y más en cómo los LLM pueden generar rápidamente conjuntos de datos con apariencia plausible que respalden cualquier hipótesis deseada, y qué significa eso para la práctica científica.

“¿Esto es realmente nuevo?”

  • Muchos dicen que la fabricación de conjuntos de datos no es novedad: desde hace tiempo la gente ha falsificado datos normalmente distribuidos o de otro tipo simples con hojas de cálculo o generadores de números aleatorios.
  • Algunos sostienen que los LLM sobre todo reducen la barrera de esfuerzo y de habilidad; los tramposos ya tenían herramientas fáciles.
  • Otros replican que hacer el fraude mucho más fácil y escalable (por ejemplo, para las fábricas de papers) es un cambio nada trivial.

Impacto en la integridad científica

  • Varios señalan que la mayoría de las falsificaciones descubiertas han sido técnicamente pobres; los falsificadores competentes probablemente pasan desapercibidos, así que mejores herramientas podrían hacer más difícil detectar el fraude de alta calidad.
  • Algunos afirman que una gran parte de la literatura existente ya es débil, está sometida a p-hacking o es irreproducible; esto se ve como un problema sistémico de incentivos y revisión por pares, no específico de la IA.
  • Un punto de vista: una falsificación más fácil quizá por fin obligue a la comunidad a adoptar estándares sólidos de reproducibilidad.
  • Otro punto de vista: en su mayor parte aumentará la “basura digital”, haciendo aún más difícil encontrar y verificar la verdad.

LLMs, verdad y confabulación

  • Punto repetido: los LLM están optimizados para producir continuaciones plausibles, no verdad; “confabulación” se propone como un término mejor que “alucinación”.
  • Algunos subrayan que este comportamiento es esperado, no un error.
  • Otros argumentan que los desarrolladores de modelos están intentando reducir las fabricaciones y hacer más fiables las herramientas específicas de dominio.

Usos legítimos de los datos sintéticos

  • Varios señalan que los datos sintéticos son una técnica establecida y valiosa en ML y en contextos de preservación de la privacidad; los datos falsos pero plausibles allí son una característica, no un error.
  • La preocupación se centra específicamente en datos sintéticos no etiquetados o engañosos que entren en el registro científico.

Posibles mitigaciones y preocupaciones más amplias

  • Sugerencias: mayor énfasis en la replicación/replicabilidad por encima de la revisión por pares por sí sola; mejores herramientas (incluida la IA) para la verificación automatizada de artículos y la detección de errores/fraude.
  • Las preocupaciones incluyen: argumentos engañosos pero llenos de citas (“CheatGPT”), sobrecarga de información y una asimetría al estilo de la ley de Brandolini, donde los malos datos se difunden más rápido de lo que pueden refutarse.