As Cadeias de Markov são os Modelos de Linguagem Originais

As cadeias de Markov estão a ser revisitadas como um precursor simples e intuitivo dos modernos modelos de linguagem de grande escala, gerando debate sobre o quanto a IA de hoje realmente avançou para além dos primeiros geradores estatísticos de texto. Os comentaristas contrastam as severas limitações dos modelos clássicos de n-gramas e de Markov ocultos com a capacidade dos transformers de modelar contexto de longo alcance, semântica e comportamento emergente, ao mesmo tempo que observam que ambos, no fim, fazem previsão do próximo token sobre texto. Muitos veem as cadeias de Markov como uma ferramenta pedagógica valiosa e um passo histórico intermédio, mas argumentam que a escala, a arquitetura e as capacidades dos LLMs representam um salto qualitativo, e não apenas quantitativo.

Âmbito da Comparação: Cadeias de Markov vs LLMs

  • Muitos lembram dos bots de texto com cadeia de Markov (IRC, fóruns, Twitter, MUDs, música, haiku) como primeiros momentos de “uau”.
  • Alguns argumentam que os LLMs parecem “cadeias de Markov melhores”, partilhando a mesma intuição de previsão do próximo token.
  • Outros insistem que a diferença é enorme: as cadeias de Markov são brinquedos divertidos; os LLMs modernos são ferramentas do dia a dia para resolução de problemas, perguntas e respostas, programação e escrita criativa.

Os LLMs são “Apenas” Cadeias de Markov?

  • Um lado:
    • Por definição, se as probabilidades do próximo token dependem apenas de um contexto limitado, isso é Markov; os LLMs qualificam-se como modelos de Markov de ordem alta ou em espaço latente.
    • Modelos de Markov podem ser definidos sobre estados arbitrários, incluindo contextos longos ou vetores latentes.
  • Lado oposto:
    • As cadeias de Markov clássicas são rasas, lineares e tipicamente baseadas em tabelas; os transformers usam redes neurais profundas e não lineares e atenção.
    • Os transformers quebram a visão simples de estado de Markov (múltiplas características, atenção sobre muitos tokens, computação oculta).
    • Alguns argumentam que equipará-los é como equiparar “peixe-dourado vs cérebro humano” ou “brinquedo de corda vs civilização”.

Distinções Técnicas e Limites

  • Cadeias de Markov: estatísticas simples / consulta em tabela, escalam mal com o contexto, semântica fraca, boas como ferramentas didáticas.
  • LLMs: milhares de milhões de parâmetros, camadas profundas não lineares, atenção, comportamentos emergentes, contexto longo e flexível.
  • Há debate sobre expressividade computacional e se os transformers têm limites fundamentais vs completude de Turing teórica com memória adicionada.
  • Modelos de Markov ocultos e modelos de espaço de estados mais recentes (por exemplo, arquiteturas do tipo S4) são mencionados como linhas relacionadas, mas distintas.

Pedagogia, Intuição e Infraestrutura

  • Vários recomendam as cadeias de Markov como uma excelente forma de ensinar “código que aprende” e de explicar LLMs a alto nível.
  • Outros enfatizam que a implementação e a infraestrutura de treino para LLMs (pipelines de dados, GPUs, esforço de engenharia) superam de longe qualquer coisa feita com modelos de Markov.
  • Recursos como implementações curtas de Markov, o trabalho de n-gramas de Norvig e vídeos educativos são citados.

Debates Filosóficos e de “Inteligência”

  • Discussões contínuas sobre “imitação vs inteligência real”, análogas a “os aviões realmente voam ou apenas imitam pássaros?”.
  • Alguns sublinham que os resultados e o comportamento importam mais do que corresponder aos mecanismos humanos; outros preocupam-se com a cognição à semelhança humana como objetivo científico.