Ask HN: Empleados de GitHub, ¿qué está pasando? ¿Por qué?

Las caídas cada vez más frecuentes de GitHub se están vinculando a una convergencia de factores: una migración dolorosa desde su infraestructura heredada hacia Microsoft Azure, un auge de actividad de programación generada por IA que, según se informa, multiplicó por 14 los commits en un año, y una carga intensa procedente de funciones como Actions y Copilot. Los comentaristas debaten si la propiedad de Microsoft y la fiabilidad de Azure son problemas centrales o si cualquier plataforma grande tendría dificultades para escalar un sistema maduro y complejo tan rápido. Muchos esperan que GitHub responda con límites más estrictos o nuevos precios para el uso gratuito y de alto volumen, pero temen que la inestabilidad crónica ya esté erosionando la confianza en lo que se ha convertido en infraestructura esencial para desarrolladores.

Diagnóstico de alto nivel

  • Dos explicaciones principales predominan:
    • Un crecimiento masivo del tráfico impulsado por IA (commits, Actions, webhooks) que está sometiendo a presión una plataforma madura.
    • Una migración difícil, de varios años, desde la pila heredada de GitHub y sus propios centros de datos hacia Azure, exponiendo nuevos modos de fallo.
  • Muchos creen que ambas se están combinando: nuevos patrones de carga golpeando una arquitectura en transición.

Adquisición por Microsoft y migración a Azure

  • Los gráficos históricos de disponibilidad muestran estabilidad antes de la adquisición y más incidencias después.
  • Algunos sostienen que esto se debe a:
    • Más funciones (Actions, Copilot, Codespaces, seguridad, paquetes) y una superficie mucho mayor donde puede fallar algo.
    • Migración en curso a Azure, incluidos entornos parciales/dobles, descrita como “dolorosa”.
  • Otros ven la correlación como evidencia de que Microsoft y/o Azure son el problema de fondo; los defensores responden que Azure ejecuta con éxito muchos servicios enormes.

Crecimiento impulsado por IA y “slop”

  • Se cita a la dirección de GitHub afirmando un crecimiento de commits de ~14x y un rápido aumento de usuarios, atribuidos a la programación con IA y agentes.
  • Muchos sospechan volúmenes enormes de tráfico de bajo valor o de bots:
    • Repos con miles de commits diminutos.
    • Bots creando repos automáticamente, instalando apps y disparando webhooks.
    • Ataques de scraping y sobreuso de CI/Actions.
  • Debate sobre si esto es una excusa válida o un fallo de planificación, dado que el crecimiento impulsado por IA lleva siendo visible más de un año.

Escalado, arquitectura y límites

  • Discusión sobre:
    • GitHub como sistema con estado compartido (repos, PRs, issues) frente a APIs de LLM en su mayoría sin estado, lo que hace más difícil escalar.
    • Rails frente a stacks “modernos”; algunos culpan a Ruby, otros dicen que la arquitectura y el diseño importan más que el lenguaje.
    • La falta de límites agresivos y de rate limiting se ve como causa raíz; se piden límites por usuario o por repo y precios.
  • Un comentario detallado, con tono de insider, presenta esto como un evento de escalado de una vez por generación sobre un sistema ya enorme, no simple incompetencia.

Impacto empresarial, organizativo y en usuarios

  • Se considera que la infraestructura es un centro de costes que compite con iniciativas de IA y otras prioridades.
  • Se culpa a múltiples rondas de despidos por la pérdida de experiencia y la lentitud en la recuperación.
  • Los usuarios sugieren:
    • Eliminar o endurecer los repos privados gratuitos e ilimitados.
    • Cobrar a usuarios intensivos o abusivos, o limitar los commits diarios.
  • Otros temen que cobrar más no arregle la calidad y que los costes de cambio mantengan a las empresas atrapadas pese al mal uptime.

Postmortem del incidente reciente (17 de agosto de 2026)

  • El informe oficial (citado en el hilo) atribuye una caída importante a:
    • Un nuevo pico de tráfico que saturó los balanceadores de carga.
    • Autoescalado mal configurado del sidecar de Istio.
    • Agotamiento de flujos de HAProxy y tormentas de reintentos, especialmente por la lógica de tokens de VS Code/Copilot.
  • Los seguimientos incluyen arreglar políticas de autoescalado, el comportamiento de reintento y la amplificación en el cliente, pero los participantes lo ven como evidencia de fallos sistémicos de fiabilidad y operación.