Comparando humanos, GPT-4 y GPT-4V en tareas de abstracción y razonamiento

Un nuevo artículo que compara GPT-4 y su variante multimodal con humanos en tareas de razonamiento visual abstracto concluye que ninguno de los modelos alcanza la abstracción a nivel humano, reavivando el debate sobre si los modelos de lenguaje grandes pueden realmente “razonar” o si solo son sofisticados reconocedores de patrones. Los comentaristas examinan la metodología del estudio, especialmente su uso de trabajadores de Mechanical Turk como línea base humana, y señalan que GPT-4 sigue teniendo dificultades con problemas espaciales y de rejillas pese a su gran rendimiento en muchas tareas de texto. El intercambio se amplía hacia cuestiones de encarnación, entrenamiento multimodal y si los sistemas basados en transformers actuales son una vía suficiente hacia la inteligencia general o solo un componente poderoso dentro de arquitecturas de IA más grandes.

¿Pueden los LLM razonar o solo reconocer patrones?

  • Un bando sostiene que los LLM solo hacen predicción del siguiente token sobre texto, carecen de modelos internos de sistemas externos y, por tanto, no pueden razonar de verdad: solo repiten patrones vistos en los datos.
  • Otros responden que eso no está demostrado; el razonamiento en sí mismo podría ser una forma de explotación de patrones, y conductas complejas pueden emerger sin haber sido diseñadas explícitamente.
  • Se citan las redes neuronales como aproximadores universales para argumentar que, en principio, el razonamiento podría emerger en transformers si es representable en su clase de funciones.
  • Un ejemplo de secuencia lógica muestra a GPT-3.5 dando una respuesta contradictoria, mientras que GPT-4 la acierta, usado tanto como evidencia de limitaciones como de una mejora rápida.

Representación, abstracción y encarnación

  • Un tema recurrente: los modelos actuales operan en el espacio de tokens/embeddings, no en realidades físicas o espaciales ancladas.
  • Varios comentaristas creen que la abstracción robusta requiere poder “simular” el dominio del problema, posiblemente en distintos espacios internos según la tarea.
  • Otros señalan trabajos multimodales (visión + lenguaje) y hallazgos de que las representaciones internas de los LLM pueden alinearse con codificadores visuales, lo que sugiere que ya existe un anclaje parcial.
  • Las tareas espaciales/de rejilla (como ConceptARC) se consideran especialmente difíciles para sistemas entrenados solo con texto, de forma análoga a humanos recién ciegos que luchan con formas visuales.

Diseño de evaluación y líneas base humanas

  • Algunos cuestionan el uso de trabajadores “maestros” de Mechanical Turk como referencia humana, señalando problemas de calidad en MTurk, posible uso de LLM por parte de trabajadores y falta de datos claros de varianza.
  • Otros responden que filtrar trabajadores de bajo esfuerzo o con comportamiento de bot es estándar y necesario, y que el resultado central —humanos ~90% frente a GPT-4 ~33%— sigue siendo informativo.
  • Preocupa que las tareas confundan abstracción con razonamiento visoespacial estrecho y que las rejillas codificadas en matrices no sean directamente comparables con la percepción visual humana.

Prompts, herramientas y sistemas compuestos

  • Varios comentaristas preguntan si el prompting con chain-of-thought, el uso de herramientas o formatos de prompt mejores elevarían significativamente las puntuaciones.
  • Algunos sostienen que la pregunta más relevante no es “¿Puede razonar un LLM puro?”, sino si puede hacerlo un LLM integrado en un bucle agéntico con memoria, herramientas y sensores.

Utilidad, exageración y direcciones futuras

  • Varios distinguen entre razonamiento de nivel AGI y utilidad actual: los LLM ya pueden superar a muchos crowdworkers en algunas tareas, aunque fallen en benchmarks abstractos.
  • Los escépticos ven el hype de los LLM como comparable al entusiasmo por las criptomonedas; otros subrayan que ya son económicamente valiosos y mejoran rápido, especialmente combinados con código, búsqueda o robótica.