Benchmarking GPT-4 Turbo – Um Conto de Advertência
Benchmarks que comparam o novo modelo GPT‑4 Turbo da OpenAI com o GPT‑4 original sugerem que o Turbo pode ter um desempenho um pouco pior em certos exercícios de programação, provavelmente porque “lembra” de menos exemplos de treino, embora ofereça inferência mais rápida, mais barata e um contexto muito maior. Os comentaristas debatem se o sucesso em conjuntos padronizados de problemas reflete raciocínio genuíno ou mera memorização, e como projetar testes justos quando os modelos são treinados em vastas porções da internet. Outros compartilham resultados do mundo real que vão de pequenas quedas de qualidade a melhorias notáveis, e apontam questões mais amplas como rigor estatístico nas avaliações, mudanças nos fluxos de trabalho de desenvolvimento e a ética de reutilizar configurações de benchmark de código aberto.
Tema geral
- A discussão gira em torno do que o benchmark Exercism realmente mede no GPT‑4 vs GPT‑4 Turbo, e se as diferenças refletem memorização, capacidade de raciocínio ou ruído.
- Muitos veem o Turbo como “mais rápido, mas um pouco mais burro”; outros argumentam que a evidência é fraca ou que o Turbo é, na verdade, melhor em seus casos de uso.
Memorização vs raciocínio
- Alguns interpretam os resultados assim: o GPT‑4 tem mais problemas de benchmark memorizados; o Turbo “esquece” mais, mas raciocina de forma semelhante em tarefas não vistas.
- Outros argumentam que identificar problemas apenas pelo título + stub de função muitas vezes pode ser feito por conhecimento geral, não por memorização exata.
- Vários comentaristas enfatizam que a memorização é uma parte central da inteligência (humana ou de máquina) e não é inerentemente “trapaça”.
- Surge a preocupação de que, quando LLMs resolvem benchmarks, eles podem estar בעיקרamente recuperando dados de treino em vez de demonstrar capacidade ampla.
LLMs realmente conseguem programar?
- Há forte discordância: alguns afirmam que o sucesso em problemas conhecidos é apenas “trapaça”, portanto não prova capacidade de programar.
- Outros relatam anedotas de LLMs escrevendo com sucesso testes e implementações para bases de código e domínios novos e privados.
- Vários observam que uma grande fração da programação humana também é lembrança de padrões; a assistência de LLMs, portanto, ainda é valiosa.
Projeto de benchmark e robustez estatística
- Vários comentários observam que o tamanho da amostra (~67 perguntas) é pequeno demais; com intervalos de confiança binomiais, a diferença entre GPT‑4 e Turbo é estatisticamente fraca.
- As pessoas pedem benchmarks maiores e mais realistas (por exemplo, tarefas multi-arquivo, programação com contexto longo) e múltiplas execuções para lidar com a aleatoriedade.
Experiências relatadas por usuários
- Alguns usuários veem o GPT‑4 superando o Turbo em SQL complexo, análise de artigos de ML e conjuntos de dados personalizados de perguntas e respostas visuais.
- Outros relatam que o Turbo é um pouco mais preciso e significativamente mais rápido em tarefas como conversão de OCR para texto estruturado ou programação no estilo Exercism por meio de outras ferramentas.
- O benchmark Exercism separado do Aider (Python) supostamente mostra o Turbo indo melhor do que variantes anteriores do GPT‑4, contradizendo o padrão do blog original.
Janelas de contexto, custos e comportamento
- O longo contexto do Turbo é elogiado, mas vários observam confiabilidade degradada além de ~30–40 mil tokens.
- Surgem perguntas sobre por que o comprimento de completion é limitado a 4.096 tokens apesar do grande contexto; as respostas sugerem restrições de custo e latência.
- Alguns especulam que o Turbo pode ser um modelo menor/distilled, trocando alguma qualidade por velocidade e inferência mais barata.
Ética, licenciamento e preocupações de avaliação
- Há preocupação com contaminação de testes: modelos fechados não podem facilmente ser verificados quanto a sobreposição com o conjunto de treino e podem superajustar benchmarks públicos.
- Um tópico lateral discute atribuição em open source e reutilização de código entre ferramentas de benchmark.
- Alguns criticam o “nerf” do modelo depois que os usuários já pagaram e comparam a otimização de benchmarks de LLMs à otimização de benchmarks de hardware.