Construindo um rig de deep learning
Construir um rig pessoal de deep learning é apresentado como uma troca entre custo inicial de hardware, taxas de aluguel na cloud e os benefícios práticos de ter computação local. Os კომენტadores comparam GPUs de consumo, rigs de mineração e sistemas boutique como o Tinybox, debatendo o ecossistema CUDA maduro da Nvidia versus a pilha ROCm da AMD, mais barata porém mais frágil. Muitos argumentam que, apesar de a economia nem sempre ser melhor, possuir GPUs locais reduz drasticamente o atrito para experimentação, privacidade de dados e cargas de trabalho de IA de longa duração.
Tinybox e AMD vs. Nvidia
- Alguns estão de olho no Tinybox (baseado em AMD) como alternativa à Nvidia, mas outros alertam que isso significa “perder tempo” com ROCm em vez de fazer trabalho com CUDA.
- Há críticas fortes de que o ROCm é frágil, mais lento que as especificações e custa semanas de configuração; outros contrapõem que versões recentes (por exemplo, suporte ao 7900XTX) “não são tão ruins” e estão melhorando.
- Há debate sobre se o domínio da Nvidia vem principalmente de um investimento superior de longo prazo em software versus comportamento anticompetitivo e lock-in do ecossistema.
- O Tinybox é visto por alguns como apenas peças prontas com margem; outros argumentam que a integração, o depuramento (por exemplo, erros PCIe AER) e o design do sistema são acréscimos de valor não triviais.
Escolhas de hardware de GPU
- 4090 vs. placas workstation Ada: variantes workstation operam com menor consumo (≈300W vs. 450W), podem ser de dois slots e suportam P2P, tornando builds “caso normal” com 4 GPUs mais fáceis.
- Muitos observam que as 4090 podem ter o limite de energia reduzido para ~300W com pouca perda de desempenho.
- Para mais de 2 GPUs, plataformas workstation/EPYC/Threadripper e frames ou gabinetes abertos no estilo mineração são temas comuns.
- PCIe x8 é geralmente visto como suficiente para a maioria do treinamento/inferência; x1 é lento demais. NVLink é frequentemente considerado exagero para rigs domésticos pequenos com múltiplas GPUs.
Economia de rig local vs. cloud
- Números de exemplo: 3×3090 na vast.ai por cerca de US$0,6/h vs. comprar 3090 usadas; ponto de equilíbrio em torno de ~128 dias de uso total, ajustado para baixo pelo valor de revenda e pela estagnação do preço das GPUs.
- Custos de eletricidade e GPUs que não se depreciam reforçam o caso da posse se a utilização for moderada a alta.
- Contra-argumento: muitos entusiastas não alcançarão o ponto de equilíbrio em comparação com clouds comunitárias baratas; cloud pode ser mais barata se a energia local for cara.
Ergonomia e experimentação
- Vários destacam o “atrito mental” da cloud cobrada por hora: as pessoas fazem menos experimentos estranhos ou exploratórios nela.
- Rigs locais parecem “de graça” depois de comprados; os usuários têm mais probabilidade de deixar execuções para a noite e mexer com frequência.
Provedores de cloud e aspectos práticos
- vast.ai e plataformas semelhantes são elogiadas pelo preço, mas criticadas por confiabilidade, largura de banda variável, possíveis “golpes” e dor para mover dados.
- runpod é mencionado como uma alternativa um pouco mais confiável.
Outro hardware e configurações
- Threadripper/EPYC/ARM (Ampere Altra) são sugeridos para maximizar pistas PCIe, embora ARM traga atrito com ferramentas/compilação.
- Macs da série M podem fazer inferência, mas são muito mais lentos e menos custo-efetivos do que GPUs de desktop, especialmente para treinamento.
- Vários posts compartilham ou pedem orientação sobre placas-mãe, frames de mineração, builds com duas 4090 e rigs domésticos pequenos usados tanto para jogos quanto para LLMs/diffusion locais.