As Cadeias de Markov são os Modelos de Linguagem Originais
As cadeias de Markov estão a ser revisitadas como um precursor simples e intuitivo dos modernos modelos de linguagem de grande escala, gerando debate sobre o quanto a IA de hoje realmente avançou para além dos primeiros geradores estatísticos de texto. Os comentaristas contrastam as severas limitações dos modelos clássicos de n-gramas e de Markov ocultos com a capacidade dos transformers de modelar contexto de longo alcance, semântica e comportamento emergente, ao mesmo tempo que observam que ambos, no fim, fazem previsão do próximo token sobre texto. Muitos veem as cadeias de Markov como uma ferramenta pedagógica valiosa e um passo histórico intermédio, mas argumentam que a escala, a arquitetura e as capacidades dos LLMs representam um salto qualitativo, e não apenas quantitativo.
Âmbito da Comparação: Cadeias de Markov vs LLMs
- Muitos lembram dos bots de texto com cadeia de Markov (IRC, fóruns, Twitter, MUDs, música, haiku) como primeiros momentos de “uau”.
- Alguns argumentam que os LLMs parecem “cadeias de Markov melhores”, partilhando a mesma intuição de previsão do próximo token.
- Outros insistem que a diferença é enorme: as cadeias de Markov são brinquedos divertidos; os LLMs modernos são ferramentas do dia a dia para resolução de problemas, perguntas e respostas, programação e escrita criativa.
Os LLMs são “Apenas” Cadeias de Markov?
- Um lado:
- Por definição, se as probabilidades do próximo token dependem apenas de um contexto limitado, isso é Markov; os LLMs qualificam-se como modelos de Markov de ordem alta ou em espaço latente.
- Modelos de Markov podem ser definidos sobre estados arbitrários, incluindo contextos longos ou vetores latentes.
- Lado oposto:
- As cadeias de Markov clássicas são rasas, lineares e tipicamente baseadas em tabelas; os transformers usam redes neurais profundas e não lineares e atenção.
- Os transformers quebram a visão simples de estado de Markov (múltiplas características, atenção sobre muitos tokens, computação oculta).
- Alguns argumentam que equipará-los é como equiparar “peixe-dourado vs cérebro humano” ou “brinquedo de corda vs civilização”.
Distinções Técnicas e Limites
- Cadeias de Markov: estatísticas simples / consulta em tabela, escalam mal com o contexto, semântica fraca, boas como ferramentas didáticas.
- LLMs: milhares de milhões de parâmetros, camadas profundas não lineares, atenção, comportamentos emergentes, contexto longo e flexível.
- Há debate sobre expressividade computacional e se os transformers têm limites fundamentais vs completude de Turing teórica com memória adicionada.
- Modelos de Markov ocultos e modelos de espaço de estados mais recentes (por exemplo, arquiteturas do tipo S4) são mencionados como linhas relacionadas, mas distintas.
Pedagogia, Intuição e Infraestrutura
- Vários recomendam as cadeias de Markov como uma excelente forma de ensinar “código que aprende” e de explicar LLMs a alto nível.
- Outros enfatizam que a implementação e a infraestrutura de treino para LLMs (pipelines de dados, GPUs, esforço de engenharia) superam de longe qualquer coisa feita com modelos de Markov.
- Recursos como implementações curtas de Markov, o trabalho de n-gramas de Norvig e vídeos educativos são citados.
Debates Filosóficos e de “Inteligência”
- Discussões contínuas sobre “imitação vs inteligência real”, análogas a “os aviões realmente voam ou apenas imitam pássaros?”.
- Alguns sublinham que os resultados e o comportamento importam mais do que corresponder aos mecanismos humanos; outros preocupam-se com a cognição à semelhança humana como objetivo científico.