Detectando textos generados por LLM con aprendizaje automático «clásico»

Los esfuerzos por detectar texto generado por modelos de lenguaje grandes (LLM) mediante clasificadores de aprendizaje automático relativamente pequeños y «clásicos» están mostrando una precisión sorprendentemente alta, inspirando ideas como extensiones de navegador que etiquetan o filtran contenido escrito por IA de forma parecida a los bloqueadores de anuncios. Los comentaristas debaten si esa detección puede llegar a ser alguna vez lo bastante fiable o justa para usos de alto riesgo como la evaluación académica o la aplicación de sanciones por plagio, dada la posibilidad de falsos positivos, la evolución de los modelos y la evasión sencilla mediante cambios de estilo o posprocesamiento. Muchos argumentan que los enfoques más realistas a largo plazo son centrarse en la procedencia y la «prueba de trabajo» (p. ej., historiales de edición) o simplemente usar los detectores como filtros heurísticos de slop para contenido de IA de bajo esfuerzo, en lugar de como árbitros definitivos de la autoría.

Detectabilidad hoy

  • Muchos sostienen que las salidas actuales de los LLM son detectablemente distintas de la escritura humana típica, especialmente los modelos de chat comerciales ajustados con RLHF con tono «corporativo / maximizador de interacción» y peculiaridades estilísticas (p. ej., longitud, matización, uso de la raya em—dash).
  • Otros contraargumentan que el texto por sí solo tiene una señal demasiado baja como para codificar de forma robusta la procedencia; como mucho estamos detectando «indicios» transitorios que desaparecerán, y comparan algunas de estas afirmaciones con la astrología.
  • Varios señalan sistemas como Pangram y el clasificador del blog (textos «gemelos» sintéticos, pequeños transformers) como evidencia de que actualmente se pueden lograr AUC altas y bajas tasas de falsos positivos, al menos en conjuntos de datos de referencia.

Fiabilidad y falsos positivos

  • Existe una fuerte preocupación por usar detectores en contextos de alto riesgo (calificaciones, empleos, acusaciones de plagio).
  • Los falsos positivos, incluso de 1 entre 10,000, se consideran inaceptables si la consecuencia es, por ejemplo, una expulsión; como mucho, las herramientas deberían ser una pieza más de evidencia, con revisión humana y vías de apelación.
  • Para la navegación casual, muchos consideran que una precisión del 80–90% es «suficiente» para saltarse probable slop sin acusar a autores concretos.

Carrera armamentista y evasión

  • Tema recurrente: cualquier detector público puede usarse como adversario (estilo GAN) para entrenar generadores y posprocesadores que lo evadan.
  • Las sugerencias incluyen muestreo de alta temperatura / avanzado, transferencia de estilo o modelos de segunda pasada que reformulen la salida.
  • Algunos creen que los grandes laboratorios no priorizan el sigilo; otros esperan que los spammers/estafadores sí lo hagan si las plataformas empiezan a bloquear el slop de IA a escala.

Deriva del lenguaje y estilo humano

  • Preocupa que el uso omnipresente de LLM desplace la escritura humana hacia la «voz LLM», degradando los detectores con el tiempo y marcando injustamente a humanos, especialmente a escritores ESL o a quienes tienen estilos formales/corporativos.
  • Otros afirman que los humanos siguen siendo más variados y peores en la optimización estricta que los modelos, así que por ahora siguen existiendo diferencias detectables.

Herramientas y usos prácticos

  • Varias referencias a extensiones de navegador y pequeños clasificadores en el dispositivo usados para etiquetar publicaciones y comentarios como probablemente generados por IA.
  • Estos se presentan como filtros personales de slop, no como herramientas forenses.

Alternativas a la detección

  • Varios sugieren centrarse en la «prueba de trabajo» (historiales de edición, borradores con marca temporal, trazas de auditoría) y medir esfuerzo/calidad en lugar de procedencia.
  • Según se informa, algunos entornos combinan detectores con trazas de auditoría para juzgar el grado de implicación de la IA.

Actitudes hacia el texto generado por IA

  • A muchos no les gusta el tono plano, excesivamente cortés e «insufrible» del contenido de IA de bajo esfuerzo, ni su longitud.
  • Una minoría dice que realmente disfruta de las salidas de LLM y que vuelve a ellas como material de referencia.