Podemos parar com as porcentagens de uptime?
Métricas de confiabilidade de serviços, como uptime de “quatro nines” e páginas de status polidas, estão sendo criticadas por serem opacas e muitas vezes enganosas, especialmente quando mascaram quedas frequentes em horário comercial que interrompem o trabalho real. Os comentaristas argumentam que porcentagens de uptime não capturam quando e como as falhas ocorrem, como elas se propagam por sistemas interconectados ou o que custam em produtividade e receita perdidas. Muitos pedem relatórios mais transparentes e centrados no usuário — como horas reais de interrupção, frequência e horário dos incidentes, e índices padronizados de confiabilidade — observando ao mesmo tempo os incentivos que os provedores têm para subnotificar ou maquiar as quedas.
Debate sobre porcentagens de uptime e “nines”
- Muitos observam que os “nines” são בעיקר ferramentas de marketing/contratuais, e não métricas de impacto para o usuário.
- Vários argumentam que leigos e executivos não entendem realmente quão diferentes são 99%, 99,9% e 99,99%.
- Outros dizem que as porcentagens ainda são úteis como uma proxy simples, especialmente para combinar sistemas independentes (multiplicando probabilidades).
- Alguns setores (trading, serviços de emergência, telecom, energia) realmente precisam de 5–6 nines; para muitos casos de SaaS, 2–3 nines podem ser economicamente suficientes.
Formas alternativas de apresentar a confiabilidade
- Forte apoio a enquadrar em tempo (por exemplo, horas de indisponibilidade por mês) em vez de apenas porcentagens; parece mais concreto (“1% é ~3,5 dias”).
- Contraponto: “12 horas afetadas” ainda é ambíguo — uma interrupção longa versus muitas curtas é uma experiência muito diferente.
- Vários querem visões mais ricas: gráficos ao longo do tempo, “tempo médio entre interrupções” e medidas centradas no usuário como:
- Uptime em horário comercial por região.
- Uptime ponderado com base no sucesso real das requisições.
- Uptime por janela de uso e índices no estilo de concessionárias de energia (SAIDI/SAIFI/CAIDI).
Timing e impacto da indisponibilidade
- Ênfase repetida de que quando as quedas ocorrem importa mais do que o total de minutos.
- Quedas em horário comercial e em pico de carga são muito mais prejudiciais do que manutenção às 3h da manhã.
- Alguns observam que, em serviços globais, “horas ruins” sempre atingem alguém, e as indisponibilidades tendem a se correlacionar com alta carga.
- Para certos fluxos de trabalho (por exemplo, execuções longas de CI), até interrupções breves podem desperdiçar horas de tempo humano.
SLAs, contratos e incentivos
- Discussão sobre SLAs agressivos (por exemplo, 6 nines) serem realistas em alguns domínios, absurdos em outros.
- Vendas frequentemente promete altos nines sem input da engenharia; reembolsos costumam ser pequenos e mais sobre direito de saída do que compensação real.
- Fornecedores às vezes excluem falhas da nuvem subjacente, enfraquecendo as garantias.
Status pages, confiança e transparência
- Muitos sentem que as páginas oficiais de status subnotificam ou minimizam problemas; monitores de terceiros são vistos como mais honestos.
- Alguns suspeitam que o uptime publicado por grandes provedores (por exemplo, incidentes recentes do GitHub/Microsoft) não corresponde à confiabilidade observada.
- Pedidos por páginas de status vinculadas diretamente ao monitoramento externo, com reporte automático de todos os incidentes, por menores que sejam.
Quanta confiabilidade é “suficiente”?
- Uma visão: a maioria das organizações paga demais por nines marginais que não melhoram materialmente os resultados; melhor investir em outra coisa.
- Visão oposta: até interrupções curtas e raras desencadeiam custos operacionais, de conformidade e reputacionais em cascata; empresas valorizam confiabilidade acima de esperteza.