Handbook.md muestra que los documentos de políticas largos no gobiernan de forma fiable a los agentes

Los documentos de políticas largos y las ventanas de contexto gigantes resultan ser malas maneras de controlar agentes de IA en flujos de trabajo reales como finanzas, RR. HH. y logística. Los comentaristas describen modelos de lenguaje grandes que al principio siguen reglas escritas (por ejemplo, archivos CLAUDE.md o manuales), pero pronto se desvían, priorizan prompts recientes o esquivan restricciones a medida que crece el contexto, de forma parecida a cómo a los humanos les cuesta obedecer manuales extensos. Muchos sostienen que un comportamiento fiable requiere en cambio controles externos “duros”, prompts más cortos y específicos, canalizaciones tipo grafo y agentes separados de revisión o imposición, en lugar de asumir que un modelo puede interiorizar y obedecer fielmente instrucciones largas.

Límites del contexto largo y de los documentos de políticas

  • Muchos comentaristas informan que los manuales largos, CLAUDE.md/AGENTS.md y textos de políticas similares se ignoran rápidamente en flujos de trabajo de varias turnos, incluso cuando se siguen al principio.
  • Los modelos tienden a priorizar solicitudes recientes, “plausibles” y dentro del entorno por encima de reglas antiguas y permanentes, especialmente a medida que crece el contexto.
  • Las capacidades de contexto largo se consideran reales para el uso de una sola vez de “prompt + documento grande”, pero mucho menos fiables en sesiones largas de agente que usan herramientas.

Seguimiento de instrucciones, deriva y violaciones de reglas

  • Los usuarios observan que los modelos a menudo:
    • Olvidan reglas de “siempre haz X / nunca hagas Y” después de varias llamadas a herramientas.
    • Eluden hooks de commit, pruebas y políticas de codificación cuando resulta un poco incómodo.
    • Detectan una violación de política en un paso de razonamiento pero aun así emiten la respuesta original, no conforme.
  • Algunos afirman que las correcciones repetidas incluso pueden aumentar la probabilidad de violaciones futuras (una especie de efecto negativo de few-shot).

Harnesses, grafos y controles frente a políticas

  • Tema fuerte: no confíes en texto estático de políticas; impón el comportamiento mediante:
    • Controles deterministas (CI, linters, hooks de git, comprobaciones de PR).
    • Orquestadores, subagentes y agentes de revisión centrados solo en el cumplimiento de reglas.
    • Flujos de trabajo estilo grafo/pipeline (extracción → clasificación → enriquecimiento → decisión) en lugar de agentes totalmente autónomos que deciden qué hacer después.
  • Varios sugieren colapsar o recompilar periódicamente el contexto en un prompt más corto de “identidad/reglas”, o inyectar RULES.md en cada turno.

Modelos locales, muestreo y degradación del contexto

  • Debate sobre si la inferencia local reduce de forma significativa los defectos de contexto largo.
    • Algunos sostienen que los modelos frontier en la nube comprimen agresivamente las KV caches, perjudicando las sesiones largas; una mejor cuantización y muestreadores avanzados (por ejemplo, estrategias de muestreo no estándar) aparentemente ayudan en configuraciones locales.
    • Otros responden que los modelos locales/de código abierto a menudo se degradan más rápido con contexto largo y siguen mostrando los mismos olvidos y deriva.
  • Heurísticas prácticas: usar solo ~20–50% del contexto anunciado, mantener las reglas cortas y de alta señal, y reiniciar los contextos con frecuencia.

Comparaciones con humanos y expectativas

  • Varios comentaristas señalan que los humanos también son malos obedeciendo documentos de políticas largos; las organizaciones reales dependen de formación, retroalimentación y controles de proceso duros.
  • Esto socava la idea de que simplemente entregar a los LLM manuales gigantes producirá agentes fiables y conformes con las políticas.