La alucinación es inevitable: una limitación innata de los grandes modelos de lenguaje
Un artículo reciente que sostiene que las alucinaciones son una consecuencia inevitable de cómo los grandes modelos de lenguaje calculan respuestas ha provocado un escrutinio más amplio sobre qué significa siquiera “alucinación” y si realmente se diferencia de una inexactitud corriente. Los comentaristas contrastan el comportamiento de los LLM con el razonamiento humano, debatiendo si estos modelos tienen algún “modelo del mundo” genuino o autoconocimiento de cuándo no saben algo, y si capas de supervisión adicionales o estimadores de confianza podrían frenar salidas falsas pero fluidas. Muchos concluyen que la fiabilidad perfecta es irrealista; la verdadera cuestión es cómo acotar, detectar o incluso aprovechar productivamente las alucinaciones en lugar de eliminarlas por completo.
Qué significa “alucinación” y si el término encaja
- Muchos sostienen que la definición del artículo (“inconsistencias con una función de verdad fundamental computable”) es simplemente “estar equivocado” o inventar cosas, no una verdadera alucinación.
- Varios comentaristas no gustan de la palabra, diciendo que antropomorfiza a los LLM y hace que el fallo suene místico o impresionante; se sugieren “confabulación” o “decir tonterías” como términos mejores.
- Otros señalan que los humanos también construyen historias internamente coherentes pero falsas, así que “alucinación” o “confabulación” tiene cierto atractivo intuitivo.
Inevitabilidad teórica vs importancia práctica
- El argumento del artículo se ve como un resultado de diagonalización / complejidad: los modelos limitados (p. ej., LLM en tiempo polinómico) no pueden calcular todas las funciones, especialmente algunas NP-hard, así que habrá entradas en las que fallen.
- Los críticos dicen: esto es cierto de cualquier sistema finito (incluidos los cerebros) y por sí solo no dice con qué frecuencia ni cuán mal ocurren los fallos en dominios realistas.
- Algunos señalan que el resultado excluye explícitamente “no lo sé” y trata sobre funciones de verdad construidas de forma adversaria, así que quizá diga poco sobre el problema cotidiano de las “alucinaciones”.
LLM, modelos del mundo y comprensión
- Un bando: los LLM son solo predictores del siguiente token, sin modelo del mundo, conceptos ni yo; el lenguaje coherente es una ilusión estadística.
- El bando opuesto: la estructura interna (p. ej., representaciones de tableros de ajedrez/Othello) muestra modelos del mundo aprendidos en los pesos, aunque sean estáticos y opacos.
- Un largo subhilo debate si un comportamiento indistinguible del humano es suficiente para llamar a esto “comprensión”, y si esa noción siquiera tiene una definición nítida.
“No lo sé”, confianza y autorreflexión
- Muchos ven una mejor gestión de la incertidumbre como el verdadero problema: lograr que los modelos digan “no lo sé” o califiquen las respuestas en vez de adivinar.
- Mecanismos sugeridos:
- Bucles de control externos (RAG, búsqueda, herramientas, modelos secundarios de “seguridad” o evaluadores, voto mayoritario entre prompts).
- Señales internas (perplejidad, volatilidad entre prompts ligeramente perturbados, puntuaciones de confianza) para bloquear o limitar respuestas.
- Los escépticos argumentan que los transformers actuales carecen de verdadera autorreflexión; cualquier puntuación de confianza es, a su vez, solo otra secuencia de tokens.
Comparaciones con la cognición humana
- Los humanos también recuerdan mal, confabulan, siguen narrativas de grupo y razonan mal; algunos ven las “alucinaciones” de los LLM como análogas, mientras otros enfatizan la mejor metacognición humana y la capacidad de abstenerse de responder.
- Varios señalan que la generatividad parecida a la alucinación es también de donde provienen la creatividad y la generación de ideas; el problema no es la alucinación per se, sino distinguir cuándo es aceptable.
Mitigaciones, diseño de sistemas e hype
- Mitigaciones propuestas: arquitecturas modulares (LLM + lógica simbólica / bases de conocimiento), módulos de supervisión parecidos a los “ejecutivos” del cerebro, reconocimiento de mundo abierto y tuberías de evaluación más sólidas.
- Algunos sostienen que los LLM seguirán siendo solo un componente en sistemas más grandes de tipo AGI, en lugar de “modelos dios”.
- El hilo contiene tanto optimismo sobre la continua escalabilidad y los avances arquitectónicos como un fuerte escepticismo de que los LLM por sí solos puedan alcanzar una AGI fiable o un comportamiento libre de alucinaciones.