Detectando textos generados por LLM con aprendizaje automático «clásico»
Los esfuerzos por detectar texto generado por modelos de lenguaje grandes (LLM) mediante clasificadores de aprendizaje automático relativamente pequeños y «clásicos» están mostrando una precisión sorprendentemente alta, inspirando ideas como extensiones de navegador que etiquetan o filtran contenido escrito por IA de forma parecida a los bloqueadores de anuncios. Los comentaristas debaten si esa detección puede llegar a ser alguna vez lo bastante fiable o justa para usos de alto riesgo como la evaluación académica o la aplicación de sanciones por plagio, dada la posibilidad de falsos positivos, la evolución de los modelos y la evasión sencilla mediante cambios de estilo o posprocesamiento. Muchos argumentan que los enfoques más realistas a largo plazo son centrarse en la procedencia y la «prueba de trabajo» (p. ej., historiales de edición) o simplemente usar los detectores como filtros heurísticos de slop para contenido de IA de bajo esfuerzo, en lugar de como árbitros definitivos de la autoría.
Detectabilidad hoy
- Muchos sostienen que las salidas actuales de los LLM son detectablemente distintas de la escritura humana típica, especialmente los modelos de chat comerciales ajustados con RLHF con tono «corporativo / maximizador de interacción» y peculiaridades estilísticas (p. ej., longitud, matización, uso de la raya em—dash).
- Otros contraargumentan que el texto por sí solo tiene una señal demasiado baja como para codificar de forma robusta la procedencia; como mucho estamos detectando «indicios» transitorios que desaparecerán, y comparan algunas de estas afirmaciones con la astrología.
- Varios señalan sistemas como Pangram y el clasificador del blog (textos «gemelos» sintéticos, pequeños transformers) como evidencia de que actualmente se pueden lograr AUC altas y bajas tasas de falsos positivos, al menos en conjuntos de datos de referencia.
Fiabilidad y falsos positivos
- Existe una fuerte preocupación por usar detectores en contextos de alto riesgo (calificaciones, empleos, acusaciones de plagio).
- Los falsos positivos, incluso de 1 entre 10,000, se consideran inaceptables si la consecuencia es, por ejemplo, una expulsión; como mucho, las herramientas deberían ser una pieza más de evidencia, con revisión humana y vías de apelación.
- Para la navegación casual, muchos consideran que una precisión del 80–90% es «suficiente» para saltarse probable slop sin acusar a autores concretos.
Carrera armamentista y evasión
- Tema recurrente: cualquier detector público puede usarse como adversario (estilo GAN) para entrenar generadores y posprocesadores que lo evadan.
- Las sugerencias incluyen muestreo de alta temperatura / avanzado, transferencia de estilo o modelos de segunda pasada que reformulen la salida.
- Algunos creen que los grandes laboratorios no priorizan el sigilo; otros esperan que los spammers/estafadores sí lo hagan si las plataformas empiezan a bloquear el slop de IA a escala.
Deriva del lenguaje y estilo humano
- Preocupa que el uso omnipresente de LLM desplace la escritura humana hacia la «voz LLM», degradando los detectores con el tiempo y marcando injustamente a humanos, especialmente a escritores ESL o a quienes tienen estilos formales/corporativos.
- Otros afirman que los humanos siguen siendo más variados y peores en la optimización estricta que los modelos, así que por ahora siguen existiendo diferencias detectables.
Herramientas y usos prácticos
- Varias referencias a extensiones de navegador y pequeños clasificadores en el dispositivo usados para etiquetar publicaciones y comentarios como probablemente generados por IA.
- Estos se presentan como filtros personales de slop, no como herramientas forenses.
Alternativas a la detección
- Varios sugieren centrarse en la «prueba de trabajo» (historiales de edición, borradores con marca temporal, trazas de auditoría) y medir esfuerzo/calidad en lugar de procedencia.
- Según se informa, algunos entornos combinan detectores con trazas de auditoría para juzgar el grado de implicación de la IA.
Actitudes hacia el texto generado por IA
- A muchos no les gusta el tono plano, excesivamente cortés e «insufrible» del contenido de IA de bajo esfuerzo, ni su longitud.
- Una minoría dice que realmente disfruta de las salidas de LLM y que vuelve a ellas como material de referencia.