Claude Code envía 33k tokens antes de leer el prompt; OpenCode envía 7k

Los asistentes de programación con IA, como Claude Code de Anthropic, están recibiendo críticas por enviar decenas de miles de tokens de “sobrecarga” —prompts de sistema, descripciones de herramientas y configuración de subagentes— antes incluso de leer la solicitud del usuario, lo que infla drásticamente los costes frente a harnesses más ligeros como OpenCode o Pi. Los comentaristas sostienen que este exceso de tokens se ve agravado por el uso agresivo de herramientas y subagentes, y puede reflejar un conflicto de interés cuando el proveedor del modelo también controla el agente que gasta los tokens. Muchos desarrolladores están respondiendo creando sus propios agentes ligeros, podando el contexto o cambiando a harnesses y modelos alternativos que ofrecen más transparencia, control y eficiencia en costes.

Sobrecarga de tokens y diseño del harness

  • Muchos señalan el gran prompt de sistema y las descripciones de herramientas de Claude Code (decenas de miles de tokens) frente a la carga mucho menor de OpenCode; Pi y algunos CLIs diminutos son aún más ligeros.
  • Algunos sostienen que el tamaño bruto del prompt no es la métrica adecuada: lo que importa es inteligencia × coste × tiempo y la finalización global de la tarea.
  • Otros responden que la “tokenflación” es real: las tareas triviales parecen consumir más tokens con el tiempo.

Subagentes y costes desbocados

  • Los subagentes se citan repetidamente como el mayor sumidero de tokens: los usuarios informan de tareas que generan docenas o incluso cientos de subagentes, agotando las cuotas rápidamente.
  • Varios los desactivan o restringen mucho (mediante ajustes, permisos o instrucciones de sistema) y encuentran que los flujos secuenciales de un solo agente son más baratos y, a menudo, no peores en calidad.
  • Otros usan subagentes de forma selectiva (por ejemplo, modelos más baratos para exploración, revisores especializados) y encuentran valor cuando se orquestan con cuidado.

Caché, poda y detalles técnicos

  • Algunos señalan que los prefijos estáticos grandes deberían aprovechar las cachés KV del proveedor y cobrarse más barato o incluso gratis en suscripciones, reduciendo el coste efectivo después de la primera llamada.
  • Otros observan TTL de caché cortos (5 minutos–1 hora) y un comportamiento opaco, por lo que los ahorros son frágiles.
  • Las herramientas de poda de contexto (por ejemplo, Dynamic Context Pruning / Sleev) generan escepticismo: pueden reducir tokens pero arriesgan degradar la capacidad y romper las cachés; la falta de transparencia preocupa.

Modelos de costes e incentivos

  • Fuerte debate sobre los incentivos:
    • Un lado afirma que Anthropic está “maximizando tokens”, especialmente al vincular suscripciones de tarifa fija a su propio harness y hacer que Claude Code sea verboso.
    • Otros argumentan que la competencia y la escasez de GPU empujan a todos hacia la eficiencia; un comportamiento derrochador arriesga perder usuarios frente a modelos más baratos (DeepSeek, modelos abiertos, etc.).
  • Algunos datos: los usuarios ven cómo los costes hipotéticos de API para flujos de trabajo similares aumentan con los meses pese a un volumen de trabajo parecido.

Harness alternativos y DIY

  • Muchos elogian OpenCode, Pi, Codex y harnesses personalizados mínimos (REPLs simples o agentes de 50–200 LOC) por ser más baratos, más controlables y a menudo igual o más efectivos.
  • Pi se percibe como intencionadamente minimalista y enchufable; a algunos les encanta, otros lo encuentran demasiado desnudo y, en la práctica, dependiente de demasiadas cosas.
  • Varios recomiendan modelos locales junto con un harness personalizado para evitar el bloqueo con el proveedor y ver exactamente qué se envía.

Calidad, UX y opacidad

  • Informes mixtos sobre la calidad de Claude Code: algunos dicen que sigue siendo el orquestador más avanzado para trabajo complejo y paralelo; otros encuentran OpenCode o Codex más rápidos, más claros y menos “sobrediseñados”.
  • Quejas sobre que Claude Code se vuelve más opaco con el tiempo: tokens de pensamiento ocultos, menos visibilidad en el uso de herramientas y comportamientos más automáticos (tests, revisiones, subagentes) que los usuarios no pidieron explícitamente.
  • Surge un patrón común: la gente acaba añadiendo instrucciones explícitas (por ejemplo, sin subagentes, sin tests para cambios triviales, prompt de sistema mínimo) para recuperar el control del coste y del comportamiento.