Cómo medimos la escritura con IA en arXiv, y dónde se rompe la medición

Un análisis de 12.750 artículos de arXiv de 2021–2026 afirma que hasta el 39% de las presentaciones recientes, y el 65% en informática, muestran señales estadísticas de escritura generada por IA, frente al 0,4% antes del lanzamiento de ChatGPT. Los comentaristas cuestionan la fiabilidad y transparencia de los detectores de IA, comparten ejemplos de falsos positivos y señalan cómo la evolución de los estilos de escritura y el uso generalizado de la “pulización” con IA difuminan la línea entre texto humano y de máquina. El hilo debate si los artículos asistidos por IA son realmente un problema, y plantea preocupaciones sobre la confianza, el fraude, la sobrecarga de revisores y la erosión de la escritura como señal de calidad en la ciencia.

Metodología y fiabilidad del detector

  • Muchos comentaristas cuestionan el rigor, la interpretabilidad y la reproducibilidad del detector, especialmente la forma en que se combinan múltiples subpuntuaciones.
  • Los usuarios informan de puntuaciones altas de “máquina” en trabajos claramente humanos y previos a los LLM (tesis, artículos antiguos, respuestas de Stack Overflow), lo que sugiere falsos positivos no triviales.
  • Otros ven que el detector funciona bien en sus propios textos y consideran que una tasa calibrada de falsos positivos previa a ChatGPT (~0,4%) es prueba de que “funciona en promedio”.
  • Entre las preocupaciones están:
    • Fugas en los datos de entrenamiento y deriva de dominio (jerga nueva, cambios de estilo).
    • Sensibilidad a LaTeX/formato.
    • Límites teóricos de la detección basada solo en texto y la convergencia de los estilos humano e IA.
  • Herramientas comerciales como Pangram y GPTZero se citan como “bastante precisas” y a la vez “fácilmente engañables”, lo que subraya el desacuerdo sobre qué significa “precisión” en la práctica.

Estimaciones de prevalencia y dónde podrían fallar

  • El aumento reportado hasta ~39% de artículos marcados como IA en total y ~65% en CS se ve por algunos como llamativo, y aproximadamente alineado con comprobaciones independientes sobre subconjuntos de arXiv.
  • Otros sostienen que la línea base es endeble: el idioma y las modas cambian, y los detectores pueden estar captando “estilo moderno” o deriva temática (p. ej., jerga de LLM) más que autoría real de IA.
  • Sugerencias: incluir preprints antiguos (anteriores a 2020), desglosar por campo y aplicar los detectores a sedes presumiblemente con mayor curación (p. ej., las mejores revistas) como control.

“¿Y qué?” Impacto en la ciencia y la confianza

  • Un sector ve poco problema inherente: si la ciencia es sólida y los artículos quedan más claros, la ayuda de la IA es aceptable; el verdadero problema es la calidad subyacente de la investigación, no quién escribió las frases.
  • La postura contraria subraya:
    • La tendencia de los LLM a alucinar hechos, citas e incluso narrativas completas de trabajos relacionados.
    • La erosión de la confianza y de las señales de calidad (una prosa pulida ya no implica esfuerzo o rigor).
    • El aumento de la carga para los revisores y del ruido frente a la señal, con analogías al spam y a la “enshittification”.
  • Se dan ejemplos de artículos con citas completamente alucinadas y de revisiones de conferencias ya tensas y de bajo esfuerzo.

Uso de LLMs para pulir textos y por autores no nativos

  • Los hablantes no nativos describen el uso de LLMs para convertir un inglés “básico” en prosa científica convencional; muchos lo ven como necesario y justo, siempre que se verifique el contenido científico.
  • Los críticos sostienen que:
    • El “pulido” a menudo introduce nuevas afirmaciones o cambia sutilmente el significado.
    • Perseguir un “estilo científico” genérico es en sí perjudicial e innecesario.
  • Hay desacuerdo sobre si esto es un uso menor de una herramienta o una coautoría sustantiva que socava la responsabilidad personal.

Incentivos, spam y carrera armamentística de la detección

  • Los comentaristas relacionan el aumento del uso de IA con incentivos estructurales: publicar o perecer, aversión a escribir y generación barata de texto.
  • Algunos esperan más “artículos spam” y abogan por tratar el texto con estilo de IA como un filtro grueso, aunque ocasionalmente rechace trabajo bueno.
  • Otros destacan el peligro de usar mal los detectores (especialmente en educación) y señalan que tanto el texto generado por IA como el que evade la IA pueden producirse fácilmente, lo que hace improbable cualquier equilibrio estable en la detección.