¿Funcionará el escalado?

El debate sobre si escalar simplemente los modelos de lenguaje grandes puede llevar a la inteligencia artificial general gira en torno a los límites de datos, las carencias arquitectónicas y lo que realmente significa “inteligencia”. Los escépticos señalan los altos requisitos de datos de los LLM, su débil planificación y razonamiento, la falta de aprendizaje continuo y las dudosas afirmaciones sobre capacidades emergentes, y sostienen que harán falta nuevas arquitecturas o sistemas encarnados. Los optimistas responden que mejores datos, entrenamiento multimodal, uso de herramientas y self-play —junto con avances algorítmicos futuros y una inversión masiva— aún podrían empujar los enfoques actuales hacia capacidades a nivel humano o más allá.

Alcance del debate

  • El hilo se centra en si escalar los LLM actuales (más datos, parámetros y cómputo) puede llevar a la AGI, frente a encontrar límites duros que requieran nuevas ideas.
  • Muchos distinguen entre “herramienta útil” (ya lograda) y “AGI” (mal definida, a menudo implícitamente parecida a la humana o superior).

Escalado, datos y límites

  • Un lado enfatiza la “lección amarga”: más datos y modelos más grandes siguen produciendo mejores capacidades; es probable que los modelos actuales estén infratrainados y sean en su mayoría solo de texto.
  • Otros argumentan que los datos son un cuello de botella duro: afirman que faltan varias órdenes de magnitud respecto de lo que sugieren las leyes de escalado, y que 100.000× más datos no es trivial.
  • Hay desacuerdo sobre si los datos corporativos privados (correos, documentos, llamadas, reuniones) y los datos sintéticos pueden cerrar plausiblemente esa brecha.
  • Varios señalan que la calidad de los datos, la curación, el orden y la destilación de datos sintéticos (por ejemplo, modelos pequeños superando a grandes anteriores) quizá importen más que el volumen bruto en este punto.

Arquitectura, razonamiento y generalización

  • Los escépticos sostienen que los transformers entrenados con predicción del siguiente token principalmente interpolan, memorizan y combinan patrones; carecen de verdadera extrapolación, razonamiento robusto, planificación y memoria a largo plazo.
  • Se citan ejemplos de fallos en tareas de planificación, benchmarks de revisión de PR y razonamiento frágil como evidencia de que el escalado por sí solo puede no solucionar estas carencias.
  • Otros responden con experiencias prácticas: los LLM resuelven tareas de programación novedosas, trabajan en bases de código privadas y muestran comportamiento multilingüe y multimodal que parece una generalización real.
  • Hay debate sobre las “capacidades emergentes”: algunos las llaman ilusiones derivadas de la elección de métricas; otros señalan saltos cualitativos claros (por ejemplo, respuesta multilingüe, generación de código).

Inteligencia humana vs. LLM

  • Las comparaciones destacan que los humanos aprenden con muchos menos datos, a través de flujos multimodales ricos y mediante muchos paradigmas de aprendizaje (no supervisado, RL, activo, etc.).
  • Algunos argumentan que los humanos son, esencialmente, modelos de secuencia avanzados; con suficiente escala y entradas más ricas, podrían surgir propiedades similares en las máquinas.
  • Otros apuntan a la complejidad del cerebro, la encarnación, los instintos, las emociones y la conciencia como algo cualitativamente distinto; dudan de que los predictores de texto puedan alcanzar la AGI sin mecanismos nuevos (bucles de planificación, aprendizaje en línea, interacción con el mundo físico).

Hype, impacto y trayectoria

  • Hay amplio acuerdo en que los LLM ya aportan un valor importante: interfaces en lenguaje natural, resumido, búsqueda semántica, asistencia de código y automatización de tareas.
  • Las opiniones divergen sobre el ciclo de hype: algunos creen que todavía estamos subiendo; otros ven sobrepromesas sobre la AGI para sostener la financiación.
  • Una visión intermedia común: los futuros sistemas “tipo AGI” probablemente serán composiciones —LLMs más herramientas, memoria, simuladores y motores de razonamiento—, más que un único modelo simplemente escalado.