¿Podemos dejar de usar los porcentajes de disponibilidad?

Las métricas de fiabilidad del servicio, como la disponibilidad de “cuatro nueves”, y las páginas de estado vistosas están siendo criticadas por ser opacas y a menudo engañosas, especialmente cuando ocultan caídas frecuentes en horario laboral que paralizan el trabajo real. Los comentaristas sostienen que los porcentajes de disponibilidad no capturan cuándo y cómo ocurren los fallos, cómo se propagan por sistemas interconectados ni cuánto cuestan en productividad y ingresos perdidos. Muchos piden informes más transparentes y centrados en el usuario —como las horas reales de interrupción, la frecuencia y el momento de los incidentes, e índices de fiabilidad estandarizados—, al tiempo que señalan los incentivos que tienen los proveedores para infrarreportar o maquillar las caídas.

Debate sobre los porcentajes de disponibilidad y los “nueves”

  • Muchos señalan que los “nueves” son principalmente herramientas de marketing / contractuales, no métricas de impacto para el usuario.
  • Varios argumentan que la gente común y los ejecutivos no entienden realmente lo diferentes que son 99%, 99.9% y 99.99%.
  • Otros dicen que los porcentajes siguen siendo útiles como una aproximación simple, especialmente para combinar sistemas independientes (multiplicando probabilidades).
  • Algunas industrias (trading, servicios de emergencia, telecomunicaciones, energía) realmente necesitan 5–6 nueves; para muchos casos de SaaS, 2–3 nueves pueden ser económicamente suficientes.

Formas alternativas de presentar la fiabilidad

  • Fuerte apoyo a expresarla como tiempo (por ejemplo, horas de inactividad por mes) en lugar de solo porcentajes; se siente más concreto (“1% es ~3.5 días”).
  • Contraargumento: “12 horas afectadas” sigue siendo ambiguo — una sola caída larga frente a muchas cortas es una experiencia muy distinta.
  • Varios quieren vistas más ricas: gráficos a lo largo del tiempo, “tiempo medio entre interrupciones” y medidas centradas en el usuario como:
    • Disponibilidad en horas laborables por región.
    • Disponibilidad ponderada según el éxito real de las solicitudes.
    • Disponibilidad del usuario en ventanas temporales e índices al estilo de las empresas eléctricas (SAIDI/SAIFI/CAIDI).

Momento e impacto de la inactividad

  • Se repite mucho que cuándo ocurren las caídas importa más que el total de minutos.
  • Las caídas en horario laboral y en picos de carga son mucho más dañinas que el mantenimiento a las 3 a.m.
  • Algunos señalan que en los servicios globales las “malas horas” siempre afectan a alguien, y las caídas tienden a correlacionarse con la alta carga.
  • Para ciertos flujos de trabajo (por ejemplo, ejecuciones largas de CI), incluso interrupciones breves pueden desperdiciar horas de tiempo humano.

SLAs, contratos e incentivos

  • Discusión sobre que los SLAs agresivos (por ejemplo, 6 nueves) son realistas en algunos dominios y absurdos en otros.
  • Ventas a menudo promete muchos nueves sin la opinión de ingeniería; los reembolsos suelen ser pequeños y se parecen más a derechos de salida que a una compensación real.
  • A veces los proveedores excluyen fallos de la nube subyacente, debilitando las garantías.

Páginas de estado, confianza y transparencia

  • Muchos sienten que las páginas oficiales de estado infrarreportan o minimizan los problemas; los monitores de terceros se ven como más honestos.
  • Algunos sospechan que la disponibilidad publicada por grandes proveedores (por ejemplo, incidentes recientes de GitHub/Microsoft) no coincide con la fiabilidad observada.
  • Hay llamados a que las páginas de estado estén vinculadas directamente a monitorización externa y a que informen automáticamente de todos los incidentes, por pequeños que sean.

¿Cuánta fiabilidad es “suficiente”?

  • Una postura: la mayoría de las organizaciones paga de más por nueves marginales que no mejoran materialmente los resultados; mejor invertir en otra cosa.
  • La postura opuesta: incluso caídas cortas y raras desencadenan costos operativos, de cumplimiento y reputacionales en cascada; las empresas valoran la fiabilidad por encima de la ingeniosidad.