Las cadenas de Markov son los modelos de lenguaje originales

Las cadenas de Markov están siendo revisadas como un precursor simple e intuitivo de los modelos de lenguaje grandes modernos, lo que provoca un debate sobre cuánto ha avanzado realmente la IA actual más allá de los primeros generadores estadísticos de texto. Los comentaristas contrastan las severas limitaciones de los modelos clásicos de n‑gramas y de Markov ocultos con la capacidad de los transformers para modelar contexto de largo alcance, semántica y comportamiento emergente, al tiempo que señalan que ambos, en última instancia, realizan predicción del siguiente token sobre texto. Muchos ven las cadenas de Markov como una valiosa herramienta de enseñanza y un peldaño histórico, pero argumentan que la escala, la arquitectura y las capacidades de los LLMs representan un salto cualitativo, no solo cuantitativo.

Alcance de la comparación: Cadenas de Markov vs LLMs

  • Muchos recuerdan los bots de texto con cadenas de Markov (IRC, foros, Twitter, MUDs, música, haiku) como los primeros momentos de “wow”.
  • Algunos sostienen que los LLMs se sienten como “mejores cadenas de Markov”, compartiendo la misma intuición de predicción del siguiente token.
  • Otros insisten en que la brecha es enorme: las cadenas de Markov son juguetes divertidos; los LLMs modernos son herramientas cotidianas para resolver problemas, preguntas y respuestas, programación y escritura creativa.

¿Son los LLMs “solo” cadenas de Markov?

  • Una postura:
    • Por definición, si las probabilidades del siguiente token dependen solo de un contexto acotado, es Markov; los LLMs califican como modelos de Markov de alto orden o en espacio latente.
    • Los modelos de Markov pueden definirse sobre estados arbitrarios, incluidos contextos largos o vectores latentes.
  • Postura opuesta:
    • Las cadenas de Markov clásicas son superficiales, lineales y normalmente basadas en tablas; los transformers usan redes neuronales profundas y no lineales y atención.
    • Los transformers rompen la simple visión de estado de Markov (múltiples características, atención sobre muchos tokens, computación oculta).
    • Algunos argumentan que equipararlos es como equiparar “pez dorado vs cerebro humano” o “juguete de cuerda vs civilización”.

Distinciones técnicas y límites

  • Cadenas de Markov: estadísticas simples / búsquedas, escalan mal con el contexto, mala semántica, buenas como herramientas didácticas.
  • LLMs: miles de millones de parámetros, capas profundas no lineales, atención, comportamientos emergentes, contexto largo y flexible.
  • Hay debate sobre la expresividad computacional y sobre si los transformers tienen límites fundamentales frente a la completitud de Turing teórica con memoria añadida.
  • Los modelos ocultos de Markov y los modelos de espacio de estados más nuevos (p. ej., arquitecturas tipo S4) se mencionan como líneas relacionadas pero distintas.

Pedagogía, intuición e infraestructura

  • Varios recomiendan las cadenas de Markov como una excelente forma de enseñar “código que aprende” y de explicar los LLMs a alto nivel.
  • Otros enfatizan que la infraestructura de implementación y entrenamiento para LLMs (canalizaciones de datos, GPUs, esfuerzo de ingeniería) eclipsa cualquier cosa hecha con modelos de Markov.
  • Se citan recursos como implementaciones cortas de Markov, el trabajo de n-gramas de Norvig y videos educativos.

Debates filosóficos y de “inteligencia”

  • Debates continuos sobre “imitación vs inteligencia real”, análogos a “¿realmente vuelan los aviones o solo imitan a las aves?”.
  • Algunos subrayan que los resultados y el comportamiento importan más que coincidir con los mecanismos humanos; otros se preocupan por la cognición similar a la humana como objetivo científico.