Una semana usando Codex más que Claude

Los programadores que comparan la herramienta Codex de OpenAI con Claude Code de Anthropic informan que Codex se siente más rápido, más centrado y menos verboso, mientras que Claude a menudo produce soluciones sobreingenierizadas y llena el código de comentarios explicativos que muchos ven como ruido. Otros contraargumentan que Claude es mejor para inferir intenciones y ofrecer ayuda arquitectónica, lo que destaca cuánto varían los resultados según la tarea, el harness y la habilidad del usuario. El hilo más amplio recorre un ecosistema en rápida evolución de modelos para programar (Sol, Fable, Grok, Gemini, DeepSeek, Kimi, etc.), y muchos desarrolladores mezclan modelos y marcos de orquestación para equilibrar coste, velocidad, fiabilidad y guardrails.

Sentimiento general: Codex vs Claude para programar

  • Muchos informan que han pasado de Claude a Codex (GPT 5.6 Sol/Luna/Terra) para programar.
  • Los principales factores: Codex se percibe como más rápido, más conciso, más “orientado al negocio” y menos agotador mentalmente.
  • El comportamiento actual de Claude suele describirse como verboso, demasiado explicativo y a veces con “actitud”, aunque algunos siguen prefiriendo su capacidad para inferir intenciones y manejar tareas ambiguas.

Comentarios de código y verbosidad

  • Fuerte rechazo a los comentarios autogenerados de Claude: prosa demasiado larga, estilo AI, historial de diffs en comentarios y “notas para mí mismo” que describen lo que el código no hace o iteraciones pasadas.
  • Muchos sostienen que esto es ruido, que debería vivir en los PRs o mensajes de commit, y que confunde tanto a humanos como a futuras ejecuciones del modelo.
  • Una minoría argumenta que esos comentarios sirven como “memoria externa” para los LLMs y ayudan a futuros agentes a evitar errores.
  • Consenso amplio: es mejor tener menos comentarios generados por IA en las bases de código, aunque los comentarios en general puedan ser valiosos.

Sobreingeniería vs pragmatismo

  • Varios dicen que Codex tiende a sobreingenierizar: arquitecturas elaboradas, enums, frameworks de validación, defensividad extrema y tamaños de diff grandes.
  • Otros consideran que Claude es más propenso a complicarlo demasiado o a “hacer demasiado”, mientras que Codex se queda más cerca del alcance solicitado.
  • Las experiencias son marcadamente contradictorias; el comportamiento parece sensible a la variante del modelo, el nivel de esfuerzo, el harness y el tipo de tarea.

Modelos vs harnesses vs proceso

  • Se enfatiza repetidamente que el comportamiento depende mucho del harness (Codex CLI/TUI, Claude Code, OMP, prime-agent, agy, Hermes Agent, etc.).
  • Algunos proponen separar el “proceso” (ciclos de planificar/implementar/revisar) en runtimes deterministas, tratando a los modelos como roles intercambiables.
  • Los patrones multiagente son populares: un modelo planifica, otro programa; o Claude y Codex critican mutuamente el trabajo del otro.

Cuotas, coste y patrones de uso

  • Hay informes mixtos sobre qué servicio es más generoso. Algunos agotan Claude rápidamente; otros alcanzan los límites de Codex en días, especialmente usando Sol Ultra.
  • Los modelos más baratos (Luna xhigh, DS Flash, modelos locales) se usan como subagentes o para ejecución masiva.
  • Muchos adaptan la elección del modelo: Sol para tareas rutinarias/de backend, Opus/Fable para diseño o arquitectura, otros modelos para velocidad o coste.

Otros modelos y ética

  • También se mencionan Grok, Gemini 3.7, DeepSeek, Kimi, GLM, Qwen y modelos locales como opciones viables.
  • Hay un subhilo intenso sobre ética y política de usar proveedores concretos (especialmente Grok), incidentes de privacidad de datos y si evitar ciertos vendedores es significativo o simplemente simbólico.