Podemos parar com as porcentagens de uptime?

Métricas de confiabilidade de serviços, como uptime de “quatro nines” e páginas de status polidas, estão sendo criticadas por serem opacas e muitas vezes enganosas, especialmente quando mascaram quedas frequentes em horário comercial que interrompem o trabalho real. Os comentaristas argumentam que porcentagens de uptime não capturam quando e como as falhas ocorrem, como elas se propagam por sistemas interconectados ou o que custam em produtividade e receita perdidas. Muitos pedem relatórios mais transparentes e centrados no usuário — como horas reais de interrupção, frequência e horário dos incidentes, e índices padronizados de confiabilidade — observando ao mesmo tempo os incentivos que os provedores têm para subnotificar ou maquiar as quedas.

Debate sobre porcentagens de uptime e “nines”

  • Muitos observam que os “nines” são בעיקר ferramentas de marketing/contratuais, e não métricas de impacto para o usuário.
  • Vários argumentam que leigos e executivos não entendem realmente quão diferentes são 99%, 99,9% e 99,99%.
  • Outros dizem que as porcentagens ainda são úteis como uma proxy simples, especialmente para combinar sistemas independentes (multiplicando probabilidades).
  • Alguns setores (trading, serviços de emergência, telecom, energia) realmente precisam de 5–6 nines; para muitos casos de SaaS, 2–3 nines podem ser economicamente suficientes.

Formas alternativas de apresentar a confiabilidade

  • Forte apoio a enquadrar em tempo (por exemplo, horas de indisponibilidade por mês) em vez de apenas porcentagens; parece mais concreto (“1% é ~3,5 dias”).
  • Contraponto: “12 horas afetadas” ainda é ambíguo — uma interrupção longa versus muitas curtas é uma experiência muito diferente.
  • Vários querem visões mais ricas: gráficos ao longo do tempo, “tempo médio entre interrupções” e medidas centradas no usuário como:
    • Uptime em horário comercial por região.
    • Uptime ponderado com base no sucesso real das requisições.
    • Uptime por janela de uso e índices no estilo de concessionárias de energia (SAIDI/SAIFI/CAIDI).

Timing e impacto da indisponibilidade

  • Ênfase repetida de que quando as quedas ocorrem importa mais do que o total de minutos.
  • Quedas em horário comercial e em pico de carga são muito mais prejudiciais do que manutenção às 3h da manhã.
  • Alguns observam que, em serviços globais, “horas ruins” sempre atingem alguém, e as indisponibilidades tendem a se correlacionar com alta carga.
  • Para certos fluxos de trabalho (por exemplo, execuções longas de CI), até interrupções breves podem desperdiçar horas de tempo humano.

SLAs, contratos e incentivos

  • Discussão sobre SLAs agressivos (por exemplo, 6 nines) serem realistas em alguns domínios, absurdos em outros.
  • Vendas frequentemente promete altos nines sem input da engenharia; reembolsos costumam ser pequenos e mais sobre direito de saída do que compensação real.
  • Fornecedores às vezes excluem falhas da nuvem subjacente, enfraquecendo as garantias.

Status pages, confiança e transparência

  • Muitos sentem que as páginas oficiais de status subnotificam ou minimizam problemas; monitores de terceiros são vistos como mais honestos.
  • Alguns suspeitam que o uptime publicado por grandes provedores (por exemplo, incidentes recentes do GitHub/Microsoft) não corresponde à confiabilidade observada.
  • Pedidos por páginas de status vinculadas diretamente ao monitoramento externo, com reporte automático de todos os incidentes, por menores que sejam.

Quanta confiabilidade é “suficiente”?

  • Uma visão: a maioria das organizações paga demais por nines marginais que não melhoram materialmente os resultados; melhor investir em outra coisa.
  • Visão oposta: até interrupções curtas e raras desencadeiam custos operacionais, de conformidade e reputacionais em cascata; empresas valorizam confiabilidade acima de esperteza.