Comparando humanos, GPT-4 e GPT-4V em tarefas de abstração e raciocínio
Um novo artigo comparando o GPT-4 e sua variante multimodal com humanos em tarefas de raciocínio visual abstrato conclui que nenhum dos modelos atinge a abstração em nível humano, reacendendo o debate sobre se grandes modelos de linguagem realmente conseguem “raciocinar” ou apenas fazem correspondência sofisticada de padrões. Os comentaristas analisam a metodologia do estudo, especialmente o uso de trabalhadores do Mechanical Turk como base humana, e observam que o GPT-4 ainda tem dificuldades com problemas espaciais e em grade, apesar do forte desempenho em muitas tarefas de texto. A discussão se expande para questões de corporeidade, treinamento multimodal e se sistemas baseados em transformers são um caminho suficiente para a inteligência geral ou apenas um componente poderoso em arquiteturas de IA maiores.
Os LLMs Conseguem Raciocinar ou Só Fazer Correspondência de Padrões?
- Um grupo argumenta que LLMs apenas preveem o próximo token sobre texto, carecem de modelos internos de sistemas externos e, portanto, não conseguem raciocinar de verdade — apenas ecoam padrões vistos nos dados.
- Outros contrapõem que isso não está provado; o raciocínio pode ele mesmo ser um tipo de exploração de padrões, e comportamentos complexos podem emergir sem terem sido explicitamente “projetados”.
- Redes neurais como aproximadores universais são citadas para argumentar que, em princípio, o raciocínio poderia emergir em transformers se for representável em sua classe de funções.
- Um exemplo de sequência lógica mostra o GPT-3.5 dando uma პასუხa autocontraditória, enquanto o GPT-4 acerta, usado tanto como evidência de limitações quanto de rápida melhoria.
Representação, Abstração e Corporeidade
- Um tema recorrente: os modelos atuais operam no espaço de tokens/embeddings, não em realidades físicas ou espaciais ancoradas.
- Vários comentaristas acham que abstração robusta exige ser capaz de “simular” o domínio do problema, possivelmente em espaços internos diferentes para cada tarefa.
- Outros apontam para trabalhos multimodais (visão + linguagem) e descobertas de que representações internas de LLMs podem se alinhar com codificadores visuais, sugerindo que alguma ancoragem parcial já está acontecendo.
- Tarefas espaciais/em grade (como ConceptARC) são vistas como particularmente difíceis para sistemas treinados em texto, de forma análoga a humanos recém-cegos lutando com formas visuais.
Projeto de Avaliação e Bases de Comparação Humanas
- Alguns questionam o uso, no artigo, de trabalhadores “master” do Mechanical Turk como referência humana, apontando problemas de qualidade no MTurk, possível uso de LLMs pelos trabalhadores e ausência de dados claros de variância.
- Outros respondem que filtrar trabalhadores de baixo esforço ou com comportamento de bot é padrão e necessário, e que o resultado central — humanos ~90% vs GPT-4 ~33% — ainda é informativo.
- Há preocupação de que as tarefas confundam abstração com raciocínio visuo-espacial estreito e de que grades codificadas em matrizes não sejam diretamente comparáveis à percepção visual humana.
Prompting, Ferramentas e Sistemas Compostos
- Vários comentaristas perguntam se prompting com chain-of-thought, uso de ferramentas ou formatos de prompt melhores aumentariam significativamente as pontuações.
- Alguns argumentam que a pergunta mais relevante não é “Um LLM nu consegue raciocinar?”, mas sim se um LLM embutido em um loop agêntico com memória, ferramentas e sensores consegue.
Utilidade, Hype e Direções Futuras
- Vários distinguem entre raciocínio em nível de AGI e utilidade atual: LLMs já podem superar muitos crowdworkers em algumas tarefas, mesmo que falhem em benchmarks abstratos.
- Céticos veem o hype dos LLMs como análogo ao entusiasmo com cripto; outros enfatizam que eles já são economicamente valiosos e melhoram rapidamente, especialmente quando combinados com código, busca ou robótica.