Construindo um rig de deep learning

Construir um rig pessoal de deep learning é apresentado como uma troca entre custo inicial de hardware, taxas de aluguel na cloud e os benefícios práticos de ter computação local. Os კომენტadores comparam GPUs de consumo, rigs de mineração e sistemas boutique como o Tinybox, debatendo o ecossistema CUDA maduro da Nvidia versus a pilha ROCm da AMD, mais barata porém mais frágil. Muitos argumentam que, apesar de a economia nem sempre ser melhor, possuir GPUs locais reduz drasticamente o atrito para experimentação, privacidade de dados e cargas de trabalho de IA de longa duração.

Tinybox e AMD vs. Nvidia

  • Alguns estão de olho no Tinybox (baseado em AMD) como alternativa à Nvidia, mas outros alertam que isso significa “perder tempo” com ROCm em vez de fazer trabalho com CUDA.
  • Há críticas fortes de que o ROCm é frágil, mais lento que as especificações e custa semanas de configuração; outros contrapõem que versões recentes (por exemplo, suporte ao 7900XTX) “não são tão ruins” e estão melhorando.
  • Há debate sobre se o domínio da Nvidia vem principalmente de um investimento superior de longo prazo em software versus comportamento anticompetitivo e lock-in do ecossistema.
  • O Tinybox é visto por alguns como apenas peças prontas com margem; outros argumentam que a integração, o depuramento (por exemplo, erros PCIe AER) e o design do sistema são acréscimos de valor não triviais.

Escolhas de hardware de GPU

  • 4090 vs. placas workstation Ada: variantes workstation operam com menor consumo (≈300W vs. 450W), podem ser de dois slots e suportam P2P, tornando builds “caso normal” com 4 GPUs mais fáceis.
  • Muitos observam que as 4090 podem ter o limite de energia reduzido para ~300W com pouca perda de desempenho.
  • Para mais de 2 GPUs, plataformas workstation/EPYC/Threadripper e frames ou gabinetes abertos no estilo mineração são temas comuns.
  • PCIe x8 é geralmente visto como suficiente para a maioria do treinamento/inferência; x1 é lento demais. NVLink é frequentemente considerado exagero para rigs domésticos pequenos com múltiplas GPUs.

Economia de rig local vs. cloud

  • Números de exemplo: 3×3090 na vast.ai por cerca de US$0,6/h vs. comprar 3090 usadas; ponto de equilíbrio em torno de ~128 dias de uso total, ajustado para baixo pelo valor de revenda e pela estagnação do preço das GPUs.
  • Custos de eletricidade e GPUs que não se depreciam reforçam o caso da posse se a utilização for moderada a alta.
  • Contra-argumento: muitos entusiastas não alcançarão o ponto de equilíbrio em comparação com clouds comunitárias baratas; cloud pode ser mais barata se a energia local for cara.

Ergonomia e experimentação

  • Vários destacam o “atrito mental” da cloud cobrada por hora: as pessoas fazem menos experimentos estranhos ou exploratórios nela.
  • Rigs locais parecem “de graça” depois de comprados; os usuários têm mais probabilidade de deixar execuções para a noite e mexer com frequência.

Provedores de cloud e aspectos práticos

  • vast.ai e plataformas semelhantes são elogiadas pelo preço, mas criticadas por confiabilidade, largura de banda variável, possíveis “golpes” e dor para mover dados.
  • runpod é mencionado como uma alternativa um pouco mais confiável.

Outro hardware e configurações

  • Threadripper/EPYC/ARM (Ampere Altra) são sugeridos para maximizar pistas PCIe, embora ARM traga atrito com ferramentas/compilação.
  • Macs da série M podem fazer inferência, mas são muito mais lentos e menos custo-efetivos do que GPUs de desktop, especialmente para treinamento.
  • Vários posts compartilham ou pedem orientação sobre placas-mãe, frames de mineração, builds com duas 4090 e rigs domésticos pequenos usados tanto para jogos quanto para LLMs/diffusion locais.