Tres cosas que los LLM nos han hecho replantearnos

Los modelos de lenguaje grandes están llevando a replantear ideas de larga data sobre la inteligencia, desde el test de Turing y la Habitación China hasta la gramática universal de Chomsky y la “pobreza del estímulo”. Quienes comentan debaten si el uso fluido del lenguaje por parte de los LLM y las capacidades emergentes implican comprensión genuina o solo un poderoso emparejamiento estadístico de patrones, y qué significa eso para estudiar la cognición humana frente a construir máquinas útiles. El hilo también explora limitaciones actuales —consistencia lógica, agencia, autoconciencia, dependencia de datos— y si el escalado continuo y los nuevos enfoques de entrenamiento podrían acabar produciendo algo cercano a la inteligencia artificial general.

Test de Turing, AGI y escalado

  • Varios comentarios sostienen que el clásico test de Turing es necesario pero no suficiente para la “inteligencia general”; los LLM actuales siguen fallando bajo interrogatorio sostenido en cuestión de minutos.
  • Otros señalan que los sistemas modernos están deliberadamente restringidos para no imitar plenamente a los humanos, por lo que los resultados del test son difíciles de interpretar.
  • A algunos les impresiona que las primeras predicciones sobre la memoria necesaria y los plazos para un diálogo similar al humano solo estén equivocadas por unos pocos órdenes de magnitud.
  • Se discuten metáforas de “escalera a la luna”: afirmaciones anteriores de que los métodos estadísticos nunca podrían alcanzar la inteligencia general ahora parecen menos convincentes; algunos creen que métodos simples, escalados, podrían llegar sorprendentemente lejos.

Chinese Room, traducción y “comprensión”

  • Un lado ve el experimento mental de la Habitación China como equivocado: si un sistema traduce lo bastante bien como para engañar a hablantes nativos, eso es operativamente equivalente a comprender.
  • Otros dicen que los LLM les cambiaron la opinión: muestran una traducción potente sin semántica al estilo humano.
  • Un argumento recurrente: la “habitación” (el sistema) puede comprender aunque un componente interno no lo haga, de forma similar a neuronas frente a cerebros.
  • Algunos califican estos debates de distracción frente a los impactos prácticos; la utilidad económica no depende de una teoría resuelta de la comprensión.

Gramática universal y aprendizaje del lenguaje humano

  • Debate sobre si los LLM estadísticos exitosos socavan la idea de que se necesita una gramática universal incorporada para aprender lenguaje.
  • Los críticos argumentan: si una máquina puede aprender lenguaje natural sin tal módulo, eso debilita las afirmaciones fuertes de universalidad o al menos las hace menos exclusivas.
  • Los defensores responden: los modelos actuales dicen poco sobre cómo aprenden los niños a partir de datos escasos; pueden aprender “lenguajes” que los humanos no pueden, así que son mala evidencia sobre la biología humana.
  • Hay desacuerdo sobre si el trabajo computacional falsifica de manera significativa las teorías lingüísticas o si en gran medida es irrelevante para ellas.

Naturaleza del pensamiento, la comprensión y el error

  • Algunos participantes dicen que el razonamiento fluido de los LLM obliga a replantearse qué es “pensar”, especialmente cuando los sistemas superan a muchos humanos en argumentación o código.
  • Otros insisten en que las contradicciones lógicas frecuentes y los fallos extraños muestran ausencia de comprensión genuina; ven redefinir “comprensión” para incluir a los LLM como mover la portería.
  • Los contraargumentos señalan que los humanos también se contradicen y albergan creencias falsas; centrarse solo en los fallos sesga la evaluación.
  • No hay consenso sobre si la “comprensión” debe ser humana o si es mejor tratarla como una propiedad conductual/funcional.

Capacidades, límites y agencia

  • Los comentaristas enumeran áreas en las que los LLM van por detrás del humano promedio: tareas prolongadas y ricas en contexto; agencia y planificación robustas; autovigilancia estable de sus propias limitaciones; escritura creativa sin clichés; e inversión lógica fiable.
  • Otros responden que muchos humanos cotidianos también recurren a tópicos y cometen errores de razonamiento; ven los déficits actuales como lagunas de ingeniería, no como límites de principio.
  • Algunos consideran a los LLM como modeladores de secuencias potentes pero estrechos que adquieren incidentalmente muchas habilidades cognitivas; para obtener un comportamiento más orientado a la agencia, hacen falta mejores objetivos de preentrenamiento y arquitecturas de control.
  • Existe la preocupación de que los modelos ya puedan desplazar “trabajo cognitivo de baja gama” independientemente de si nos enseñan algo sobre la cognición humana.

Impacto en la ciencia, la lingüística y la sociedad

  • Un bando sostiene que los modelos estadísticos, como los submarinos frente a los peces, pueden ser tecnologías transformadoras pero revelar poco sobre los mecanismos humanos subyacentes.
  • Otro bando argumenta que construir estos sistemas ya restringe las teorías del lenguaje y la cognición al mostrar que algunos requisitos supuestos no son estrictamente necesarios.
  • Algunos temen que los avances en LLM reduzcan el interés por la lingüística/ciencia cognitiva tradicionales, porque el progreso práctico en IA puede avanzar sin una comprensión teórica más profunda.
  • Otros enfatizan la escalabilidad: incluso un sistema que no sea del todo humano, si puede replicarse de forma barata, podría dominar dominios concretos de problemas y transformar la sociedad.