Construyendo un equipo de deep learning
Construir un equipo personal de deep learning se presenta como una compensación entre el costo inicial del hardware, las tarifas de alquiler en la nube y los beneficios prácticos de tener cómputo local. Los comentaristas comparan GPU de consumo, rigs de minería y sistemas boutique como Tinybox, debatiendo entre el ecosistema CUDA maduro de Nvidia y el stack ROCm de AMD, más barato pero más frágil. Muchos sostienen que, aunque la economía pura a veces sea peor, tener GPU locales reduce drásticamente la fricción para experimentar, mejora la privacidad de los datos y facilita cargas de trabajo de IA de larga duración.
Tinybox y AMD vs. Nvidia
- Algunos están considerando Tinybox (basado en AMD) como alternativa a Nvidia, pero otros advierten que eso significa “perder tiempo” con ROCm en lugar de avanzar con CUDA.
- Hay críticas fuertes de que ROCm es frágil, lento en comparación con las especificaciones y que requiere semanas de configuración; otros responden que las versiones recientes (por ejemplo, compatibilidad con 7900XTX) “no están tan mal” y están mejorando.
- Debate sobre si el dominio de Nvidia se debe principalmente a una inversión superior a largo plazo en software o a un comportamiento anticompetitivo y al bloqueo del ecosistema.
- Algunos ven Tinybox como nada más que piezas estándar con sobreprecio; otros argumentan que la integración, la depuración (por ejemplo, errores PCIe AER) y el diseño del sistema aportan un valor no trivial.
Opciones de hardware GPU
- 4090 frente a tarjetas de estación de trabajo Ada: las variantes de estación de trabajo funcionan a menor potencia (≈300W frente a 450W), pueden ser de doble ranura y soportan P2P, lo que facilita construcciones “normales” de 4 GPU.
- Muchos señalan que las 4090 se pueden limitar de potencia a ~300W con poca pérdida de rendimiento.
- Para más de 2 GPU, son comunes las plataformas de estación de trabajo/EPYC/Threadripper y los marcos abiertos o cajas tipo minería.
- En general, se considera que PCIe x8 es suficiente para la mayoría del entrenamiento/inferencia; x1 es demasiado lento. NVLink a menudo se considera excesivo para pequeños rigs domésticos multi-GPU.
Economía de rig local vs. nube
- Ejemplo de números: 3×3090 en vast.ai a ~$0.6/h frente a comprar 3090 usadas; el punto de equilibrio ronda ~128 días de uso total, ajustado a la baja por el valor de reventa y el estancamiento del precio de las GPU.
- Los costos de electricidad y las GPU que no se deprecian fortalecen el caso de la propiedad si la utilización es moderada o alta.
- Contraargumento: muchos aficionados no alcanzarán el punto de equilibrio frente a nubes comunitarias baratas; la nube puede ser más barata si la energía local es cara.
Ergonomía y experimentación
- Varios destacan la “fricción mental” de la nube facturada por hora: la gente hace menos experimentos raros o exploratorios allí.
- Los rigs locales se sienten “gratis” una vez comprados; los usuarios son más propensos a dejar trabajos corriendo toda la noche y a experimentar con frecuencia.
Proveedores de nube y aspectos prácticos
- vast.ai y plataformas similares son elogiadas por su precio pero criticadas por su fiabilidad, ancho de banda variable, posibles “estafas” y el dolor de mover datos.
- runpod se menciona como una alternativa algo más fiable.
Otro hardware y configuraciones
- Se sugiere Threadripper/EPYC/ARM (Ampere Altra) para maximizar líneas PCIe, aunque ARM introduce fricción de herramientas/compilación.
- Los Mac de la serie M pueden hacer inferencia, pero son mucho más lentos y menos rentables que las GPU de escritorio, especialmente para entrenamiento.
- Varios mensajes comparten o buscan orientación sobre placas base, marcos de minería, configuraciones dual-4090 y rigs domésticos pequeños usados tanto para gaming como para LLM/diffusion locales.