LLMs por tasa de alucinación

Las afirmaciones de que GPT‑4 y otros grandes modelos de lenguaje ahora alucinan tan solo un 3% del tiempo en tareas de resumir desencadenan un debate sobre cuán significativos son realmente esos benchmarks. Los comentaristas cuestionan la metodología (incluido el uso de un modelo para juzgar a otro), discuten si “alucinación” o “confabulación” es el concepto correcto y señalan que el rendimiento cae bruscamente fuera de tareas estrechas como el resumen. Muchos ven las alucinaciones como inherentes a las arquitecturas autorregresivas actuales y enfatizan la necesidad de mejores formas de detectarlas, contextualizarlas o rediseñar alrededor de ellas antes de confiar en los LLM para usos de alto riesgo.

Naturaleza de las “alucinaciones” de los LLM

  • Visión central: la predicción autorregresiva token por token produce inherentemente suposiciones; no puedes eliminar por completo las fabricaciones.
  • Algunos sostienen que los LLM siempre están haciendo el mismo proceso, así que o bien “siempre están alucinando” o el término es engañoso.
  • Otros subrayan que, aunque el mecanismo es el mismo, las salidas difieren en corrección factual; la “tasa de alucinación” sigue siendo una métrica útil.

Comparaciones con la cognición humana

  • Varios comentarios señalan que los humanos también “rellenan huecos”, malinterpretan preguntas o afirman falsedades con seguridad; las suposiciones son necesarias para una comunicación eficiente.
  • Hay desacuerdo sobre si la inteligencia requiere rellenar huecos frente a saber cuándo decir “no lo sé”.
  • Algunos comparan el comportamiento de los LLM con las historias de niños pequeños o con “brain farts” y confabulaciones, especialmente cuando la memoria o el contexto son limitados.

Arquitecturas y mitigaciones

  • Alternativas propuestas: modelos que trabajen internamente durante un tiempo y luego emitan una respuesta completa en lugar de flujos autorregresivos.
  • Técnicas discutidas: chain-of-thought, autocrítica retroalimentando salidas previas, verificación iterativa hasta la “convergencia”.
  • Se desea que los modelos respondan más a menudo “no lo sé”, pero existe escepticismo sobre si los LLM actuales representan realmente conocimiento o verdad internamente.
  • Se barajan ideas como un “token de retroceso” o un RLHF más agresivo para penalizar la fabricación, pero los datos y la implementación no están claros.

Debates terminológicos

  • Muchos argumentan que “alucinación” es la metáfora equivocada; se prefiere “confabulación” o “suposición estadística”.
  • Objeción de que “alucinación” antropomorfiza sistemas que solo modelan lenguaje, no percepción ni verdad.

Alcance y metodología del benchmark

  • La tabla de clasificación es solo de resumir, lo que los comentaristas consideran una tarea con relativamente pocas alucinaciones; las cifras pueden no generalizarse.
  • La detección de alucinaciones usa otro modelo; los críticos señalan que si la detección basada en modelos fuera totalmente fiable, en gran medida ya habríamos resuelto el problema.
  • Se menciona una crítica externa a la metodología del benchmark; por ello, algunos dan poco peso a los porcentajes reportados.
  • Nótese que ~17% de los documentos fueron rechazados por al menos un modelo debido a filtros de contenido.

Diferencias entre modelos y fiabilidad práctica

  • La tasa de alucinación en resumen de ~3% de GPT‑4 es ampliamente puesta en duda; los usuarios informan tasas de error mucho más altas en preguntas de nicho o técnicas, especialmente código (bibliotecas/funciones inexistentes).
  • Algunos observan que Mistral y otros modelos producen con facilidad “disparate plausible”, posiblemente debido a decisiones de RLHF.
  • Los comentaristas enfatizan que, para aplicaciones críticas, incluso las mejores tasas actuales siguen siendo inaceptablemente altas sin supervisión humana.