No estoy de acuerdo con Geoff Hinton respecto a "autocompletado glorificado"

Las afirmaciones de que los grandes modelos de lenguaje son “solo autocompletado glorificado” se contrastan con el contraargumento de que la predicción muy precisa de la siguiente palabra puede requerir modelos internos genuinos de significado o “comprensión”. Los comentaristas examinan qué significan realmente la comprensión, la inteligencia y los modelos del mundo, comparando los LLM con la cognición humana, las IA que juegan juegos y el software tradicional, y destacando carencias actuales como la memoria a largo plazo, la planificación, el comportamiento dirigido por objetivos y la abstracción fiable. Aunque muchos coinciden en que los modelos de hoy están por debajo del razonamiento similar al humano, hay desacuerdo sobre si la escala y un mejor entrenamiento acabarán cerrando esa brecha o si harían falta arquitecturas fundamentalmente nuevas.

Estilo de ChatGPT y prompting

  • Varios comentaristas no soportan la verbosidad por defecto de ChatGPT ni su estilo cargado de listas.
  • Mitigaciones mencionadas: instrucciones personalizadas (“sé muy conciso”), prompts explícitos de tono/extensión, o pedir después que “lo reescriba con menos verborrea”.
  • Algunos señalan que los modelos base son menos verbosos y que RLHF amplifica la cortesía y la longitud.

“Autocompletado” vs. “Comprensión”

  • Un bando: la predicción del siguiente token puede seguir siendo puramente estadística; predecir con precisión no requiere “comprensión”.
  • Otros sostienen que una predicción muy capaz en la práctica requiere construir abstracciones internas y modelos del mundo, lo cual es una forma de comprensión.
  • Varias personas señalan que “comprensión” está mal definida; según la definición, tanto los humanos como los LLM pueden comprender, o ninguno lo hace.
  • Algunos dicen que insistir en que solo los humanos pueden “de verdad” comprender es simplemente antropocentrismo o semántica.

Paralelismos con la cognición humana

  • Muchos señalan que el cerebro humano también hace procesamiento predictivo en el lenguaje y la percepción; gran parte del habla cotidiana se siente como “autocompletado”.
  • Se traza una distinción entre pensamiento asociativo rápido (Sistema 1) y razonamiento deliberativo lento (Sistema 2); algunos sostienen que los LLM muestran sobre todo un comportamiento parecido al Sistema 1, con razonamiento emergente ocasional parecido al Sistema 2.
  • Otros subrayan que los humanos tienen objetivos, memoria a largo plazo y pueden planificar antes de hablar, mientras que los LLM carecen de objetivos intrínsecos y memoria persistente.

Capacidades, generalización y limitaciones

  • Ejemplos en los que los LLM funcionan bien: nuevos problemas de matemáticas, ayuda con programación, acertijos de lógica (a veces), aprender nuevas sintaxis en conversación.
  • Contraejemplos: fallos frágiles ante ligeras variaciones de acertijos, benchmarks de abstracción visual (p. ej., ConceptARC) y errores “necios” en matemáticas o código que indican una comprensión conceptual superficial.
  • Varios destacan la falta de criterio: los humanos a veces reformulan o rechazan la pregunta (p. ej., aconsejando una solución más simple sin código), mientras que los LLM tienden a ceñirse a la tarea planteada.
  • Las alucinaciones y la dificultad para decir “no lo sé” se señalan como limitaciones clave.

Arquitecturas, procesos de Markov e información

  • Debate sobre si los transformers son “solo cadenas de Markov”:
    • Un lado: el contexto finito y la dependencia del siguiente paso parecen markovianos.
    • El otro lado: el estado interno y la atención sobre todo el contexto violan las suposiciones markovianas simples; llamarles Markov se ve como una simplificación excesiva.
  • Algunos sostienen que minimizar la entropía cruzada sobre texto más regularización empuja de hecho a los modelos hacia representaciones comprimidas del “grafo de información” subyacente del mundo.

Modelos del mundo, semántica y verdad

  • Desacuerdo sobre si los LLM modelan el mundo o solo patrones en el texto humano.
  • Una visión: “mapean los mapas” (textos sobre la realidad), no la realidad misma, algo parecido a una versión sofisticada de la Habitación China.
  • Otros responden que los humanos también solo acceden al mundo mediante datos sensoriales limitados y el lenguaje; ambos sistemas construyen modelos internos a partir de evidencia indirecta.
  • Hay discusión sobre la capacidad de los LLM para distinguir verdad de ficción, con referencias (dentro del hilo) a trabajos sobre calibración e incertidumbre; los escépticos replican que los modelos todavía carecen de una noción fundamentada de la verdad.

AGI, metas móviles y analogías

  • La mayoría coincide en que los LLM actuales no son AGI; siguen fallando de formas “tontas” pese a sus buenas puntuaciones en benchmarks.
  • Algunos argumentan que los críticos siguen “moviendo las metas” (por ejemplo, exigiendo la invención de nuevas matemáticas) cada vez que se alcanza una capacidad.
  • AlphaZero/Go se usa como analogía: el autojuego con un objetivo claro muestra cuán poderosas pueden ser la predicción y el reconocimiento de patrones, pero otros advierten que los juegos son mundos cerrados, a diferencia del lenguaje abierto y la realidad.

Meta: utilidad del marco de “autocompletado”

  • Algunos ven “autocompletado glorificado” como despectivo pero técnicamente compatible con una inteligencia fuerte: un “autocompletado” lo bastante potente podría incorporar razonamiento profundo.
  • Otros consideran que el debate sobre etiquetas (“autocompletado”, “comprensión”, “inteligencia”) es menos útil que la evaluación empírica concreta de capacidades y modos de fallo.