Las mejores IA siguen suspendiendo pruebas de CI

Las afirmaciones de que los modelos de IA más avanzados siguen “suspendiendo” pruebas estándar de CI reavivan el debate sobre si esas pruebas realmente miden la inteligencia de las máquinas. Quienes comentan argumentan que los modelos de lenguaje grandes son potentes predictores del siguiente token con una generalidad impresionante pero superficial, limitados por la visión y el razonamiento, por un “razonamiento” basado en gran parte en memorización y por la dificultad con problemas verdaderamente novedosos. Muchos concluyen que las puntuaciones de CI y etiquetas como AGI importan menos que la utilidad en el mundo real y el rápido ritmo de crecimiento de las capacidades, que podría volver obsoletos los benchmarks actuales.

Relevancia de las pruebas de CI para la IA

  • Muchos sostienen que las pruebas de CI son una mala forma de evaluar los LLM: están diseñadas y validadas para humanos, especialmente dentro de una franja estrecha de capacidad, no para sistemas de máquina con arquitecturas distintas.
  • Otros señalan que el CI (y el factor g) sigue siendo el mejor sustituto empíricamente validado de la inteligencia humana y de los resultados en la vida, así que al menos es una referencia interesante.
  • Las discrepancias se centran en si el CI mide sobre todo el reconocimiento de patrones frente a habilidades más amplias como la creatividad, la resolución de problemas y la “inteligencia fluida”.
  • Algunos ven el bajo rendimiento de los LLM en CI como algo más condenatorio para las pruebas que para los modelos; otros lo ven como una evidencia clara de que los LLM no son “inteligentes”.

Naturaleza de la “inteligencia” de los LLM

  • Una visión: los LLM son “solo predictores del siguiente token” / almacenamiento comprimido con pérdida de texto web, buenos para imitar pero no para pensar.
  • Contraargumento: una predicción perfecta del siguiente token requeriría una comprensión profunda de los procesos subyacentes; los modelos actuales ya muestran cierto razonamiento emergente.
  • Varios señalan que los humanos también “alucinan” disparates plausibles cuando están fuera de su profundidad, difuminando la frontera entre el comportamiento humano y el de la máquina.
  • No existe una definición consensuada de inteligencia, lo que lleva a peleas esencialmente semánticas sobre si los LLM califican o si ya se ha alcanzado la “AGI”.

Problemas de visión y del formato de las pruebas

  • Muchos sostienen que los ejemplos concretos de CI prueban sobre todo visión/codificación, no razonamiento.
  • Sugerencias: presentar problemas al estilo Raven como texto, JSON o arte ASCII en lugar de imágenes; algunos experimentos muestran que entonces los modelos a menudo los resuelven correctamente, aunque de forma estocástica.
  • Suspender preguntas basadas en imágenes se compara con evaluar el CI de una persona ciega con acertijos puramente visuales.

Capacidades, límites y alucinaciones

  • Los LLM pueden igualar o superar a los humanos en algunas tareas textuales tipo CI y en algunos benchmarks matemáticos, pero tienen dificultades con la aritmética precisa, la generalización más allá de los datos de entrenamiento y el razonamiento abstracto robusto.
  • La investigación citada sugiere que gran parte del “razonamiento” es en realidad memorización de patrones, aunque puede existir cierto razonamiento genuino.

AGI, hype y trayectoria futura

  • Las opiniones van desde “ya tenemos AGI a nivel de imitación del humano promedio” hasta “los LLM están sobrevalorados, son máquinas de patrones de un palmo de profundidad”.
  • Algunos enfatizan la utilidad práctica (“¿puede hacer el trabajo?”) por encima de las etiquetas filosóficas.
  • Otros ponen el acento en el rápido progreso, el número de parámetros todavía muy por debajo del de los cerebros, y esperan avances significativos a corto plazo, especialmente en visión.