SSDs tornaram-se rápidos, exceto na nuvem

O armazenamento SSD em nuvem muitas vezes entrega muito menos throughput e latência mais alta do que drives NVMe modernos de consumidor, mesmo em instâncias “otimizadas para armazenamento” dos principais provedores. Os comentaristas atribuem essa diferença a escolhas de arquitetura como armazenamento anexado à rede ou fortemente virtualizado, firmware conservador e gerenciamento de desgaste, e projetos que priorizam durabilidade e migração ao vivo em vez de velocidade bruta. A discussão se amplia para uma crítica à economia e às abstrações da nuvem, com muitos argumentando que, para cargas intensivas em IO ou estáveis, hardware dedicado ou em colo com NVMe local pode ser drasticamente mais rápido e mais barato do que opções de nuvem pública.

Nuvem vs. bare metal e provedores menores

  • Muitos argumentam que cargas de trabalho intensivas em IO são mal atendidas pelas grandes nuvens: IOPS e throughput são caros e limitados; servidores dedicados ou colo com NVMe são “muito mais baratos” para uso sustentado.
  • Outros contrapõem que o TCO deve incluir energia, espaço, banda, peças de reposição e equipe; para equipes pequenas, o offload operacional da nuvem pode superar as economias de hardware.
  • Alternativas sugeridas à AWS incluem DigitalOcean, Hetzner, OVH, Scaleway, UpCloud (block storage rápido), Entrywan, OCI e várias opções de PaaS gerenciado (por exemplo, Supabase). Foram levantadas preocupações sobre congelamentos de verificação de identidade da Hetzner.
  • Há interesse ativo em configurações híbridas: usar a nuvem para elasticidade e overflow, mas executar cargas de trabalho estáveis e intensivas em IO em metal próprio ou alugado.

Por que os SSDs em nuvem têm desempenho inferior

  • Um tema recorrente: muito do “SSD” em nuvem é anexado à rede (EBS, PD-SSD, Azure managed disks) com:
    • Latência mais alta do que NVMe local.
    • Banda compartilhada entre muitos tenants.
    • Camadas extras (hypervisors, firmware, schedulers) que trocam throughput de pico por justiça, durabilidade e latência previsível.
  • Contraponto: todas as grandes nuvens também oferecem SSD verdadeiramente local/de instância (AWS instance store, GCP Local SSD, Azure temp/cached disks) que é ligado por PCIe, mas:
    • Efêmero (os dados são perdidos ao parar/migrar).
    • Ainda assim limitado bem abaixo das velocidades modernas de NVMe de consumidor, provavelmente devido à virtualização e ao firmware do controlador.

Benchmarks e relatos

  • Múltiplos relatos de NVMe de consumidor ou de pequenos servidores (3–7 GB/s, ~1–1,5M IOPS, dezenas de µs de latência) superando amplamente:
    • Instâncias otimizadas para armazenamento da AWS, que na prática entregam ~2–3 GB/s por dispositivo e ~500k IOPS de 4k.
    • SSDs Premium da Azure, que mostram latência de 0,4–3 ms; os SSDs locais de cache/temp disks da Azure podem atingir ~40 µs e acelerar drasticamente bancos de dados.
  • Alguns consideram que as CPUs em nuvem também parecem mais lentas em comparação com especificações semelhantes no papel; a virtualização e gerações mais antigas em SKUs baratos são suspeitas.

Latência, arquitetura e trade-offs

  • Para bancos de dados e cargas de trabalho intensivas em índices, a latência de acesso aleatório e as cadeias de dependência importam mais do que a largura de banda bruta; armazenamento em rede prejudica isso.
  • SSD local usado como cache (por exemplo, “SSD cache” do Rails, read-caching da Azure) pode ser quase tão eficaz quanto RAM para muitas cargas web, a um custo muito menor.
  • Debate sobre projetar para “escala planetária” na nuvem vs. começar com uma única máquina poderosa (SQLite/Postgres + muita RAM/NVMe) e só adicionar complexidade distribuída quando realmente necessário.

Economia, incentivos e tendências

  • Vários comentaristas afirmam que as nuvens capturam a maior parte dos ganhos dos avanços de hardware (NVMe, CPUs mais novas) por meio de preços e limitação; o desempenho por dólar melhora lentamente para os clientes.
  • Há a percepção de um movimento pequeno, mas crescente, em direção a on-prem/híbrido, especialmente para cargas de trabalho de IA e analytics grandes e intensivas em dados.
  • Alguns especulam que SSDs locais baratos/GPUs e preocupações com privacidade podem empurrar mais funcionalidades de volta para thin clients, embora as restrições de mobile continuem sendo um limitador.