Uma semana usando Codex mais do que Claude

Programadores comparando a ferramenta Codex, da OpenAI, com o Claude Code, da Anthropic, relatam que o Codex parece mais rápido, mais focado e menos prolixo, enquanto o Claude frequentemente produz soluções sobreengenheiradas e enche o código de comentários explicativos que muitos veem como ruído. Outros contrapõem que o Claude é melhor em inferir intenções e fornecer ajuda arquitetural, destacando como os resultados variam muito conforme a tarefa, o harness e a habilidade do usuário. O debate mais amplo percorre um ecossistema em rápida mudança de modelos para programação (Sol, Fable, Grok, Gemini, DeepSeek, Kimi etc.), com muitos desenvolvedores combinando modelos e frameworks de orquestração para equilibrar custo, velocidade, confiabilidade e salvaguardas.

Sentimento Geral: Codex vs Claude para Programação

  • Muitos relatam ter migrado de Claude para Codex (GPT 5.6 Sol/Luna/Terra) para programação.
  • Os principais motivos: Codex é percebido como mais rápido, mais conciso, mais “corporativo” e menos mentalmente exaustivo.
  • O comportamento atual do Claude é frequentemente descrito como prolixo, excessivamente explicativo e às vezes “cheio de atitude”, embora alguns ainda prefiram sua capacidade de inferir intenção e lidar com tarefas ambíguas.

Comentários de Código e Verbosidade

  • Forte aversão aos comentários gerados automaticamente pelo Claude: prosa excessivamente longa, estilo de IA, histórico de diff nos comentários e “notas para mim mesmo” que descrevem o que o código não faz ou iterações anteriores.
  • Muitos argumentam que isso é ruído, deveria ficar em PRs/commits e confunde tanto humanos quanto futuras execuções do modelo.
  • Uma minoria argumenta que esses comentários servem como “memória externa” para LLMs e ajudam agentes futuros a evitar erros.
  • Consenso geral: menos comentários gerados por IA nas bases de código é melhor, mesmo que comentários em geral possam ser valiosos.

Sobreengenharia vs Pragmatismo

  • Vários dizem que o Codex tende a sobreengenheirar: arquiteturas elaboradas, enums, frameworks de validação, defensividade extrema e grandes tamanhos de diff.
  • Outros acham que o Claude é mais propenso a complicar demais ou a “fazer demais”, enquanto o Codex fica mais próximo do escopo pedido.
  • As experiências são fortemente contraditórias; o comportamento parece sensível à variante do modelo, nível de esforço, harness e tipo de tarefa.

Modelos vs Harnesses vs Processo

  • Ênfase repetida de que o comportamento depende muito do harness (Codex CLI/TUI, Claude Code, OMP, prime-agent, agy, Hermes Agent, etc.).
  • Alguns defendem separar “processo” (ciclos de planejar/implementar/revisar) em runtimes determinísticos, tratando os modelos como papéis intercambiáveis.
  • Padrões multiagente são populares: um modelo planeja, outro codifica; ou Claude e Codex criticam o trabalho um do outro.

Cotas, Custo e Padrões de Uso

  • Relatos mistos sobre qual serviço é mais generoso. Alguns esgotam o Claude rapidamente; outros atingem os limites do Codex em dias, especialmente usando Sol Ultra.
  • Modelos mais baratos (Luna xhigh, DS Flash, modelos locais) são usados como subagentes ou para execução em massa.
  • Muitos ajustam a escolha do modelo: Sol para rotina/backend, Opus/Fable para design ou arquitetura, outros modelos para velocidade ou custo.

Outros Modelos e Ética

  • Grok, Gemini 3.7, DeepSeek, Kimi, GLM, Qwen e modelos locais também são mencionados como opções viáveis.
  • Há um forte subfio sobre ética e política de usar determinados provedores (especialmente Grok), incidentes de privacidade de dados e se evitar certos fornecedores é significativo ou apenas simbólico.