Talvez devêssemos acompanhar regularmente o quão importante é cada servidor
Quando a refrigeração ou a energia falha em um data center ou sala de servidores de uma universidade, saber exatamente quais sistemas podem ser sacrificados e quais devem permanecer online se torna crítico. Os comentaristas contrapõem as filosofias de infraestrutura “pets vs. cattle”, observando que, mesmo em setups modernos, em nuvem ou baseados em Kubernetes, ainda é preciso ter inventários claros de ativos, mapas de dependência e níveis de criticidade acordados para os serviços. Restrições de orçamento, hardware legado e governança acadêmica muitas vezes impedem a redundância ideal, então as organizações dependem de documentação, etiquetagem e planos praticados de redução de carga para diminuir o impacto das interrupções.
Refrigeração redundante e restrições da instalação
- Muitos defendem N+1 ou refrigeração com múltiplas unidades (por exemplo, 4–5 unidades menores) para evitar pontos únicos de falha; unidades padrão menores podem ser mais baratas no total e mais fáceis de manter.
- Outros observam que universidades muitas vezes carecem de capital, espaço físico e influência no projeto, especialmente em edifícios antigos “históricos”, então redundância e modernização são difíceis de financiar apesar das economias de energia no longo prazo.
- Alguns comparam redundância a seguro: deixá-la de lado é uma decisão explícita de risco cujo custo real aparece durante interrupções.
“Pets vs cattle” e a importância dos servidores
- Vários comentaristas dizem que o mantra “cattle, não pets” não se encaixa em muitos ambientes: academia, HPC, telecom e empresas com muito legado ainda têm sistemas únicos, não intercambiáveis.
- Mesmo em ambientes de “cattle”, é preciso priorizar quais serviços permanecem no ar sob capacidade restrita; a metáfora pode obscurecer dependências reais e “pets ocultos” frágeis (por exemplo, storage, DNS, raízes de SDN).
- Outros defendem a metáfora como um impulso para padronização, automação e infraestrutura fungível, mas admitem que ela pode virar um meme que limita o pensamento.
Rastreamento de ativos, documentação e dependências
- Vários comentários enfatizam a importância de ter um inventário de ativos, etiquetar por aplicação e criticidade, e documentar a finalidade do servidor e suas interdependências.
- Algumas organizações se recusam a operar máquinas que não estejam vinculadas a um serviço documentado; a qualidade da documentação melhora após incidentes, quando os responsáveis sentem na pele o custo de serem classificados incorretamente como “pouco importantes”.
- Rastrear grafos de dependência (e testá-los periodicamente desligando coisas) é visto como crucial para evitar falhas transitivas surpreendentes.
Priorização, política e realidades organizacionais
- Esquemas de classificação de criticidade podem ser distorcidos pela política; se tudo é “crítico”, o planejamento falha. Compartilhamento de custos ou obrigações operacionais vinculadas ao status de alta criticidade podem contrariar isso.
- Estruturas organizacionais acadêmicas e “feudais” complicam a priorização centralizada e as abordagens de plataforma.
Virtualização, nuvem e Kubernetes
- A virtualização é amplamente elogiada por permitir migração de VMs, snapshotting e desligamentos concentrados de hosts menos importantes.
- A nuvem é vista como excelente para redundância entre múltiplos data centers e geográfica, embora alguns argumentem que ela é dramaticamente mais cara e que muitas cargas de trabalho ainda não são adequadas.
- O Kubernetes é destacado como útil para reduzir carga no nível de pod/carga de trabalho e abstrair qual máquina física executa o quê, mas ainda exige priorização explícita e um projeto cuidadoso de storage.