La compresión es predicción

La compresión y la predicción se tratan cada vez más como dos caras de la misma moneda, y muchos señalan que los modelos de IA modernos —especialmente los modelos de lenguaje grandes— pueden entenderse como compresores potentes y con pérdida de sus datos de entrenamiento. Los comentaristas conectan esta idea con la teoría de la información de Shannon, la complejidad de Kolmogorov, el Hutter Prize y las técnicas clásicas de compresión, observando que una mejor predicción implica una mejor compresión y que esto podría explicar cómo surgen modelos del mundo abstractos e ideas aparentemente novedosas a partir del entrenamiento. Otros reaccionan contra eslóganes simplificados como “la compresión es inteligencia”, argumentando que la generalización, la creatividad y el conocimiento del mundo real requieren más que una codificación óptima de datos pasados, y subrayando la importancia de la validación experimental y del contexto histórico para estos conceptos.

Idea establecida: compresión, predicción, teoría de la información

  • Muchos señalan que esto es teoría de la información estándar: una buena compresión requiere una buena predicción probabilística del siguiente símbolo.
  • Los compresores estadísticos modelan distribuciones y codifican los eventos probables con menos bits; esto es directamente análogo a la predicción del siguiente token en los modelos de lenguaje.
  • Algunos subrayan que esta conexión se conoce desde hace décadas, con trabajos previos sobre inferencia inductiva, complejidad de Kolmogorov y medidas de similitud basadas en compresión.
  • Otros enfatizan que “la compresión es predicción” es una simplificación excesiva: la compresión usa la predicción, pero no es idéntica a ella en todos los contextos.

LLMs, modelos del mundo e “ideas nuevas”

  • Varios comentarios usan la perspectiva de la compresión para contrarrestar las afirmaciones de que “los LLMs solo repiten como loros”: el entrenamiento puede verse como encontrar un modelo compacto del proceso que genera los datos, no solo memorizar curvas.
  • Analogía: ajustar una función compacta al movimiento planetario te permite predecir órbitas no observadas; del mismo modo, un modelo de lenguaje aproxima los procesos que generaron el texto humano y puede generalizar más allá del conjunto de entrenamiento.
  • Algunos argumentan que las “ideas nuevas” en los humanos también son recombinaciones/deducciones a partir de datos previos; en ese sentido, los modelos avanzados podrían hacer lo mismo.
  • Otros insisten en que la predicción por sí sola no puede producir nuevo conocimiento sobre el mundo físico sin experimentos.

Límites, generalización y cambio de distribución

  • Los críticos señalan una advertencia clave: predicción≈compresión solo se sostiene con claridad cuando las distribuciones de entrenamiento y de prueba coinciden.
  • Sobreajustar para lograr la máxima compresión en un conjunto de datos fijo puede perjudicar el rendimiento en datos futuros o desplazados; esto se compara con los clásicos compromisos entre generalización y sobreajuste.
  • Algunos responden que cualquier compresor que modele mejor la fuente verdadera acabará comprimiendo mejor también los datos futuros, pero reconocen que esto depende de la distribución.

Compresores como generadores (y viceversa)

  • Varios comentarios explican que cualquier compresor probabilístico puede convertirse en un generador autorregresivo: probar cada posible siguiente token, ver cuál se co-comprime mejor y muestrear en consecuencia.
  • Experimentos con compresores neuronales y compresores basados en LLMs muestran resultados sólidos tanto dentro de la distribución como en texto no visto, a menudo superando a herramientas tradicionales en bits por byte.
  • Sin embargo, los compresores tradicionales siguen siendo muy malos generadores de texto en la práctica, lo que ilustra que “ser un compresor” es necesario pero no suficiente para una predicción de alta calidad.

Comprensión, abstracción y con pérdida frente a sin pérdida

  • Hay una discusión lateral extensa sobre si “comprender es compresión con pérdida”:
    • Un bando: la abstracción/generalización es exactamente una pérdida selectiva de información, es decir, decidir qué detalles no importan.
    • Otro bando: puedes comprimir la sintaxis sin pérdida y con cero comprensión semántica; una compresión con pérdida de alta calidad puede correlacionarse más con la comprensión genuina.
  • Enseñanza, comprensión y aplicación se presentan como distintas fases de compresión/descompresión en los humanos.

Inteligencia, conciencia y alcance

  • Algunos ven vínculos estrechos entre compresión, inteligencia e incluso estética (la belleza como descripción eficiente, la física como la compresión última).
  • Otros advierten contra extender demasiado la idea: que los LLMs sean buenos compresores no implica por sí solo conciencia; con esa lógica, los compresores de archivos comunes también serían candidatos.
  • Aun así, muchos esperan que los sistemas de compresión/predicción cada vez más potentes requieran modelos del mundo cada vez más ricos.

Críticas al artículo y a la pedagogía

  • Varios comentaristas valoran las imágenes y creen que el texto es una exposición accesible para no expertos.
  • Otros critican la presentación como si las ideas se hubieran “descubierto” recientemente, con demasiado poco contexto histórico o citas de trabajos anteriores.
  • Hay debate sobre cuánto fondo y atribución debería incluir una entrada de blog popular frente a mantener las explicaciones ligeras y atractivas.