Posición: Los LLM no pueden saltar

Un artículo de posición que sostiene que los grandes modelos de lenguaje no pueden hacer saltos de intuición “al estilo Einstein” ha provocado debate sobre si los sistemas de IA actuales están estructuralmente limitados al reconocimiento de patrones y la deducción. Los comentaristas cuestionan la afirmación de que las intuiciones abducivas que cambian el mundo requieran anclaje sensorial o intuición física, y señalan los modelos multimodales, los sistemas agénticos y los resultados matemáticos recientes como evidencia de que las capacidades quizá sigan escalando. Muchos ven el problema abierto real en cómo definir y medir rigurosamente esos “saltos”, y si harán falta arquitecturas o regímenes de entrenamiento futuros —no solo LLM más grandes— para lograrlos.

Alcance de la afirmación “los LLM no pueden saltar”

  • El hilo se centra en si los LLM actuales pueden realizar saltos “abductivos” (nuevas hipótesis fundamentales) similares a las ideas clave de la relatividad general.
  • Muchos argumentan que el artículo es sobre todo una pieza de posición, no respaldada por puntos de referencia cuantitativos ni por una operacionalización clara de “saltar”.
  • A otros les gusta el encuadre de inducción frente a deducción frente a abducción, pero cuestionan si la abducción está lo bastante bien definida como para justificar afirmaciones de “incapacidad estructural”.

Aterrizaje sensorial, modelos del mundo e intuición

  • Una línea de argumentación: los grandes saltos teóricos (p. ej., la relatividad) dependieron de experimentos mentales encarnados y anclados en lo sensorial; los LLM solo de texto carecen de esto.
  • Contraargumentos:
    • Los humanos hacen saltos abstractos en matemáticas e informática con un vínculo sensorial directo mínimo.
    • Los LLM pueden ejecutar experimentos mentales basados en texto y ya manejan hasta cierto punto intuiciones de física.
    • Los modelos multimodales y los sistemas agénticos con herramientas o simuladores quizá ya aproximen modelos del mundo.
  • Varios comentaristas piensan que los modelos del mundo dedicados y los bucles de retroalimentación física son prometedores, pero que los resultados actuales son mixtos o “abismales” para el razonamiento general.

Matices históricos y de física

  • Varios comentaristas sostienen que el artículo simplifica en exceso la historia de la relatividad, las transformaciones de Lorentz y las influencias de Einstein.
  • Debate sobre cuán “intuitivo” es realmente el principio de equivalencia; algunos lo encuentran obvio, otros lo ven profundamente contraintuitivo.
  • Idea más amplia: muchos grandes avances fueron incrementales sobre un ecosistema de investigación activo, no saltos místicos singulares.

Pruebas empíricas y limitaciones de datos/tiempo

  • Experimentos propuestos:
    • Entrenar un LLM moderno solo con texto anterior a 1980/1990 o de la época victoriana y ver si puede “reinventar” los LLM o la física moderna.
    • Usar LLM futuros (con cortes más antiguos) para reproducir artículos recientes de “salto”.
  • Dificultades señaladas: escasez de datos de entrenamiento antes de internet, filtración de conceptos modernos y sesgo retrospectivo en qué documentos históricos se conservaron.

Capacidades, límites y “cambio de la portería”

  • Algunos argumentan que todo “los LLM no pueden…” del pasado ha terminado en “los LLM pueden, pero mal, y luego mejor con escala”, así que las afirmaciones de imposibilidad categórica son sospechosas.
  • Otros insisten en que hay límites actuales claros: demostraciones matemáticas largas, mantenimiento de bases de código sin supervisión, datos de entrenamiento autogenerados fiables (colapso del modelo) y novedad genuina en humor o ciencia.
  • Varios ven a los LLM como “calculadoras de lenguaje” potentes que amplifican la intuición y la creatividad humanas en lugar de reemplazarlas; humanos+LLM podrían hacer juntos los saltos incluso si los modelos solos no lo hacen.