Comparando humanos, GPT-4 y GPT-4V en tareas de abstracción y razonamiento
Un nuevo artículo que compara GPT-4 y su variante multimodal con humanos en tareas de razonamiento visual abstracto concluye que ninguno de los modelos alcanza la abstracción a nivel humano, reavivando el debate sobre si los modelos de lenguaje grandes pueden realmente “razonar” o si solo son sofisticados reconocedores de patrones. Los comentaristas examinan la metodología del estudio, especialmente su uso de trabajadores de Mechanical Turk como línea base humana, y señalan que GPT-4 sigue teniendo dificultades con problemas espaciales y de rejillas pese a su gran rendimiento en muchas tareas de texto. El intercambio se amplía hacia cuestiones de encarnación, entrenamiento multimodal y si los sistemas basados en transformers actuales son una vía suficiente hacia la inteligencia general o solo un componente poderoso dentro de arquitecturas de IA más grandes.
¿Pueden los LLM razonar o solo reconocer patrones?
- Un bando sostiene que los LLM solo hacen predicción del siguiente token sobre texto, carecen de modelos internos de sistemas externos y, por tanto, no pueden razonar de verdad: solo repiten patrones vistos en los datos.
- Otros responden que eso no está demostrado; el razonamiento en sí mismo podría ser una forma de explotación de patrones, y conductas complejas pueden emerger sin haber sido diseñadas explícitamente.
- Se citan las redes neuronales como aproximadores universales para argumentar que, en principio, el razonamiento podría emerger en transformers si es representable en su clase de funciones.
- Un ejemplo de secuencia lógica muestra a GPT-3.5 dando una respuesta contradictoria, mientras que GPT-4 la acierta, usado tanto como evidencia de limitaciones como de una mejora rápida.
Representación, abstracción y encarnación
- Un tema recurrente: los modelos actuales operan en el espacio de tokens/embeddings, no en realidades físicas o espaciales ancladas.
- Varios comentaristas creen que la abstracción robusta requiere poder “simular” el dominio del problema, posiblemente en distintos espacios internos según la tarea.
- Otros señalan trabajos multimodales (visión + lenguaje) y hallazgos de que las representaciones internas de los LLM pueden alinearse con codificadores visuales, lo que sugiere que ya existe un anclaje parcial.
- Las tareas espaciales/de rejilla (como ConceptARC) se consideran especialmente difíciles para sistemas entrenados solo con texto, de forma análoga a humanos recién ciegos que luchan con formas visuales.
Diseño de evaluación y líneas base humanas
- Algunos cuestionan el uso de trabajadores “maestros” de Mechanical Turk como referencia humana, señalando problemas de calidad en MTurk, posible uso de LLM por parte de trabajadores y falta de datos claros de varianza.
- Otros responden que filtrar trabajadores de bajo esfuerzo o con comportamiento de bot es estándar y necesario, y que el resultado central —humanos ~90% frente a GPT-4 ~33%— sigue siendo informativo.
- Preocupa que las tareas confundan abstracción con razonamiento visoespacial estrecho y que las rejillas codificadas en matrices no sean directamente comparables con la percepción visual humana.
Prompts, herramientas y sistemas compuestos
- Varios comentaristas preguntan si el prompting con chain-of-thought, el uso de herramientas o formatos de prompt mejores elevarían significativamente las puntuaciones.
- Algunos sostienen que la pregunta más relevante no es “¿Puede razonar un LLM puro?”, sino si puede hacerlo un LLM integrado en un bucle agéntico con memoria, herramientas y sensores.
Utilidad, exageración y direcciones futuras
- Varios distinguen entre razonamiento de nivel AGI y utilidad actual: los LLM ya pueden superar a muchos crowdworkers en algunas tareas, aunque fallen en benchmarks abstractos.
- Los escépticos ven el hype de los LLM como comparable al entusiasmo por las criptomonedas; otros subrayan que ya son económicamente valiosos y mejoran rápido, especialmente combinados con código, búsqueda o robótica.