Una semana usando Codex más que Claude
Los programadores que comparan la herramienta Codex de OpenAI con Claude Code de Anthropic informan que Codex se siente más rápido, más centrado y menos verboso, mientras que Claude a menudo produce soluciones sobreingenierizadas y llena el código de comentarios explicativos que muchos ven como ruido. Otros contraargumentan que Claude es mejor para inferir intenciones y ofrecer ayuda arquitectónica, lo que destaca cuánto varían los resultados según la tarea, el harness y la habilidad del usuario. El hilo más amplio recorre un ecosistema en rápida evolución de modelos para programar (Sol, Fable, Grok, Gemini, DeepSeek, Kimi, etc.), y muchos desarrolladores mezclan modelos y marcos de orquestación para equilibrar coste, velocidad, fiabilidad y guardrails.
Sentimiento general: Codex vs Claude para programar
- Muchos informan que han pasado de Claude a Codex (GPT 5.6 Sol/Luna/Terra) para programar.
- Los principales factores: Codex se percibe como más rápido, más conciso, más “orientado al negocio” y menos agotador mentalmente.
- El comportamiento actual de Claude suele describirse como verboso, demasiado explicativo y a veces con “actitud”, aunque algunos siguen prefiriendo su capacidad para inferir intenciones y manejar tareas ambiguas.
Comentarios de código y verbosidad
- Fuerte rechazo a los comentarios autogenerados de Claude: prosa demasiado larga, estilo AI, historial de diffs en comentarios y “notas para mí mismo” que describen lo que el código no hace o iteraciones pasadas.
- Muchos sostienen que esto es ruido, que debería vivir en los PRs o mensajes de commit, y que confunde tanto a humanos como a futuras ejecuciones del modelo.
- Una minoría argumenta que esos comentarios sirven como “memoria externa” para los LLMs y ayudan a futuros agentes a evitar errores.
- Consenso amplio: es mejor tener menos comentarios generados por IA en las bases de código, aunque los comentarios en general puedan ser valiosos.
Sobreingeniería vs pragmatismo
- Varios dicen que Codex tiende a sobreingenierizar: arquitecturas elaboradas, enums, frameworks de validación, defensividad extrema y tamaños de diff grandes.
- Otros consideran que Claude es más propenso a complicarlo demasiado o a “hacer demasiado”, mientras que Codex se queda más cerca del alcance solicitado.
- Las experiencias son marcadamente contradictorias; el comportamiento parece sensible a la variante del modelo, el nivel de esfuerzo, el harness y el tipo de tarea.
Modelos vs harnesses vs proceso
- Se enfatiza repetidamente que el comportamiento depende mucho del harness (Codex CLI/TUI, Claude Code, OMP, prime-agent, agy, Hermes Agent, etc.).
- Algunos proponen separar el “proceso” (ciclos de planificar/implementar/revisar) en runtimes deterministas, tratando a los modelos como roles intercambiables.
- Los patrones multiagente son populares: un modelo planifica, otro programa; o Claude y Codex critican mutuamente el trabajo del otro.
Cuotas, coste y patrones de uso
- Hay informes mixtos sobre qué servicio es más generoso. Algunos agotan Claude rápidamente; otros alcanzan los límites de Codex en días, especialmente usando Sol Ultra.
- Los modelos más baratos (Luna xhigh, DS Flash, modelos locales) se usan como subagentes o para ejecución masiva.
- Muchos adaptan la elección del modelo: Sol para tareas rutinarias/de backend, Opus/Fable para diseño o arquitectura, otros modelos para velocidad o coste.
Otros modelos y ética
- También se mencionan Grok, Gemini 3.7, DeepSeek, Kimi, GLM, Qwen y modelos locales como opciones viables.
- Hay un subhilo intenso sobre ética y política de usar proveedores concretos (especialmente Grok), incidentes de privacidad de datos y si evitar ciertos vendedores es significativo o simplemente simbólico.