¿Por qué los LLMs son tan crédulos?

Las afirmaciones de que los modelos de lenguaje grandes son “crédulos” provocan un debate sobre si sus fallos reflejan una inteligencia de tipo infantil, un simple patrón estadístico o incentivos desalineados para ser siempre útiles. Los comentaristas discuten hasta dónde deben llevarse las metáforas humanas, y algunos subrayan que los LLMs carecen de conciencia, objetivos y comprensión genuina, mientras que otros señalan que su comportamiento cada vez se parece más al razonamiento humano pese a estar entrenados solo para predecir texto. El hilo también aborda implicaciones de seguridad, como jailbreaks y prompt injection, y si los sistemas futuros deberían desconfiar más de la entrada del usuario para evitar comportamientos dañinos.

Antropomorfismo y comparaciones de “nivel infantil”

  • Algunos sostienen que los LLMs están en un “nivel infantil” de desarrollo y que progresarán a través de etapas análogas.
  • Otros discrepan: el desarrollo cognitivo humano está mal definido, y mapear el progreso de los LLMs sobre etapas infantiles se considera engañoso o especulativo.
  • Contraargumento: usar tablas de desarrollo humano como referencias aproximadas de capacidades se defiende como útil en la práctica, aunque no implique que los LLMs sean literalmente como niños.

¿Realmente razonan los LLMs, o solo autocompletan?

  • Un bando subraya a los LLMs como “autocompletado avanzado” entrenado solo para la predicción del siguiente token, no para la comprensión genuina ni el razonamiento abstracto.
  • Otros argumentan que esto descarta comportamientos emergentes: incluso mecanismos simples pueden generar capacidades complejas parecidas al razonamiento, y no tenemos una definición precisa de “pensar” para descartarlo.
  • Existe tensión entre ver a los LLMs como “loros estocásticos” frente a aproximadores de funciones potencialmente capaces, que podrían aproximarse al pensamiento de tipo humano dada la escala y la arquitectura.

Credulidad, alineación y confianza

  • Algunos interpretan la credulidad como un subproducto de que los modelos están muy entrenados para seguir instrucciones del usuario (RLHF), por lo que “se dejan llevar” incluso con prompts adversarios (p. ej., “napalm grandma”).
  • Hay debate sobre si realmente querríamos que futuros sistemas desconfíen u overriden a los usuarios; un modelo más “desconfiado” podría ser más seguro, pero también menos usable.
  • Otros objetan que atribuir “confianza”, “valores” u “honestidad” a los LLMs actuales es antropomórfico; son solo sesgos en la generación de patrones, no motivaciones internas.

Optimización estadística vs cognición humana

  • Una visión: la optimización estadística está bien especificada y es mecanicista, mientras que el razonamiento cognitivo no lo está, lo que hace sospechosa la comparación directa.
  • Otros responden que tampoco entendemos del todo los “pasos” internos de las redes entrenadas, así que el contraste está exagerado.
  • Hay desacuerdo sobre si los cerebros humanos son fundamentalmente distintos de, o simplemente variantes más eficientes de, grandes aprendices estadísticos de patrones.

Seguridad, filtros y defensas contra jailbreaks

  • Se sugieren “prompts invisibles” fijos o filtros de IA separados para preprocesar y posprocesar entradas/salidas.
  • Los críticos señalan que qué cuenta como “ofensivo” o “directo” es en sí mismo difuso y dependiente del contexto, lo que hace difícil un filtrado perfecto.
  • Los jailbreaks se ven como explotaciones de contextos fuera de distribución, no secuunturales, donde el condicionamiento de seguridad es débil.

Desacuerdos de nivel meta

  • Algunos se quejan de que el hilo está lleno de afirmaciones fuertes pero débilmente respaldadas por ambos lados.
  • Un tema recurrente: carecemos de definiciones claras y verificables de inteligencia, razonamiento o comprensión, así que las declaraciones seguras sobre lo que los LLMs “nunca” pueden ser o hacer se consideran prematuras.