Uma semana usando Codex mais do que Claude
Programadores comparando a ferramenta Codex, da OpenAI, com o Claude Code, da Anthropic, relatam que o Codex parece mais rápido, mais focado e menos prolixo, enquanto o Claude frequentemente produz soluções sobreengenheiradas e enche o código de comentários explicativos que muitos veem como ruído. Outros contrapõem que o Claude é melhor em inferir intenções e fornecer ajuda arquitetural, destacando como os resultados variam muito conforme a tarefa, o harness e a habilidade do usuário. O debate mais amplo percorre um ecossistema em rápida mudança de modelos para programação (Sol, Fable, Grok, Gemini, DeepSeek, Kimi etc.), com muitos desenvolvedores combinando modelos e frameworks de orquestração para equilibrar custo, velocidade, confiabilidade e salvaguardas.
Sentimento Geral: Codex vs Claude para Programação
- Muitos relatam ter migrado de Claude para Codex (GPT 5.6 Sol/Luna/Terra) para programação.
- Os principais motivos: Codex é percebido como mais rápido, mais conciso, mais “corporativo” e menos mentalmente exaustivo.
- O comportamento atual do Claude é frequentemente descrito como prolixo, excessivamente explicativo e às vezes “cheio de atitude”, embora alguns ainda prefiram sua capacidade de inferir intenção e lidar com tarefas ambíguas.
Comentários de Código e Verbosidade
- Forte aversão aos comentários gerados automaticamente pelo Claude: prosa excessivamente longa, estilo de IA, histórico de diff nos comentários e “notas para mim mesmo” que descrevem o que o código não faz ou iterações anteriores.
- Muitos argumentam que isso é ruído, deveria ficar em PRs/commits e confunde tanto humanos quanto futuras execuções do modelo.
- Uma minoria argumenta que esses comentários servem como “memória externa” para LLMs e ajudam agentes futuros a evitar erros.
- Consenso geral: menos comentários gerados por IA nas bases de código é melhor, mesmo que comentários em geral possam ser valiosos.
Sobreengenharia vs Pragmatismo
- Vários dizem que o Codex tende a sobreengenheirar: arquiteturas elaboradas, enums, frameworks de validação, defensividade extrema e grandes tamanhos de diff.
- Outros acham que o Claude é mais propenso a complicar demais ou a “fazer demais”, enquanto o Codex fica mais próximo do escopo pedido.
- As experiências são fortemente contraditórias; o comportamento parece sensível à variante do modelo, nível de esforço, harness e tipo de tarefa.
Modelos vs Harnesses vs Processo
- Ênfase repetida de que o comportamento depende muito do harness (Codex CLI/TUI, Claude Code, OMP, prime-agent, agy, Hermes Agent, etc.).
- Alguns defendem separar “processo” (ciclos de planejar/implementar/revisar) em runtimes determinísticos, tratando os modelos como papéis intercambiáveis.
- Padrões multiagente são populares: um modelo planeja, outro codifica; ou Claude e Codex criticam o trabalho um do outro.
Cotas, Custo e Padrões de Uso
- Relatos mistos sobre qual serviço é mais generoso. Alguns esgotam o Claude rapidamente; outros atingem os limites do Codex em dias, especialmente usando Sol Ultra.
- Modelos mais baratos (Luna xhigh, DS Flash, modelos locais) são usados como subagentes ou para execução em massa.
- Muitos ajustam a escolha do modelo: Sol para rotina/backend, Opus/Fable para design ou arquitetura, outros modelos para velocidade ou custo.
Outros Modelos e Ética
- Grok, Gemini 3.7, DeepSeek, Kimi, GLM, Qwen e modelos locais também são mencionados como opções viáveis.
- Há um forte subfio sobre ética e política de usar determinados provedores (especialmente Grok), incidentes de privacidade de dados e se evitar certos fornecedores é significativo ou apenas simbólico.