LLMs por tasa de alucinación
Las afirmaciones de que GPT‑4 y otros grandes modelos de lenguaje ahora alucinan tan solo un 3% del tiempo en tareas de resumir desencadenan un debate sobre cuán significativos son realmente esos benchmarks. Los comentaristas cuestionan la metodología (incluido el uso de un modelo para juzgar a otro), discuten si “alucinación” o “confabulación” es el concepto correcto y señalan que el rendimiento cae bruscamente fuera de tareas estrechas como el resumen. Muchos ven las alucinaciones como inherentes a las arquitecturas autorregresivas actuales y enfatizan la necesidad de mejores formas de detectarlas, contextualizarlas o rediseñar alrededor de ellas antes de confiar en los LLM para usos de alto riesgo.
Naturaleza de las “alucinaciones” de los LLM
- Visión central: la predicción autorregresiva token por token produce inherentemente suposiciones; no puedes eliminar por completo las fabricaciones.
- Algunos sostienen que los LLM siempre están haciendo el mismo proceso, así que o bien “siempre están alucinando” o el término es engañoso.
- Otros subrayan que, aunque el mecanismo es el mismo, las salidas difieren en corrección factual; la “tasa de alucinación” sigue siendo una métrica útil.
Comparaciones con la cognición humana
- Varios comentarios señalan que los humanos también “rellenan huecos”, malinterpretan preguntas o afirman falsedades con seguridad; las suposiciones son necesarias para una comunicación eficiente.
- Hay desacuerdo sobre si la inteligencia requiere rellenar huecos frente a saber cuándo decir “no lo sé”.
- Algunos comparan el comportamiento de los LLM con las historias de niños pequeños o con “brain farts” y confabulaciones, especialmente cuando la memoria o el contexto son limitados.
Arquitecturas y mitigaciones
- Alternativas propuestas: modelos que trabajen internamente durante un tiempo y luego emitan una respuesta completa en lugar de flujos autorregresivos.
- Técnicas discutidas: chain-of-thought, autocrítica retroalimentando salidas previas, verificación iterativa hasta la “convergencia”.
- Se desea que los modelos respondan más a menudo “no lo sé”, pero existe escepticismo sobre si los LLM actuales representan realmente conocimiento o verdad internamente.
- Se barajan ideas como un “token de retroceso” o un RLHF más agresivo para penalizar la fabricación, pero los datos y la implementación no están claros.
Debates terminológicos
- Muchos argumentan que “alucinación” es la metáfora equivocada; se prefiere “confabulación” o “suposición estadística”.
- Objeción de que “alucinación” antropomorfiza sistemas que solo modelan lenguaje, no percepción ni verdad.
Alcance y metodología del benchmark
- La tabla de clasificación es solo de resumir, lo que los comentaristas consideran una tarea con relativamente pocas alucinaciones; las cifras pueden no generalizarse.
- La detección de alucinaciones usa otro modelo; los críticos señalan que si la detección basada en modelos fuera totalmente fiable, en gran medida ya habríamos resuelto el problema.
- Se menciona una crítica externa a la metodología del benchmark; por ello, algunos dan poco peso a los porcentajes reportados.
- Nótese que ~17% de los documentos fueron rechazados por al menos un modelo debido a filtros de contenido.
Diferencias entre modelos y fiabilidad práctica
- La tasa de alucinación en resumen de ~3% de GPT‑4 es ampliamente puesta en duda; los usuarios informan tasas de error mucho más altas en preguntas de nicho o técnicas, especialmente código (bibliotecas/funciones inexistentes).
- Algunos observan que Mistral y otros modelos producen con facilidad “disparate plausible”, posiblemente debido a decisiones de RLHF.
- Los comentaristas enfatizan que, para aplicaciones críticas, incluso las mejores tasas actuales siguen siendo inaceptablemente altas sin supervisión humana.