DeepSeek V4 Flash en una sola AMD MI300X
Los desarrolladores están experimentando con ejecutar el modelo de lenguaje grande DeepSeek V4 Flash en una sola GPU AMD MI300X, explorando si el hardware de datacenter de gama alta puede hacer que la inferencia autoalojada sea viable económica y técnicamente. Los comentaristas sopesan las compensaciones entre las API en la nube y poseer o alquilar GPU, destacando factores como el precio por token, la utilización, la privacidad, los límites de ventana de contexto y la disponibilidad de hardware. La conversación también sitúa estas decisiones en el contexto del auge de la inversión en IA, cuestionando si el gasto actual en infraestructura y los precios subvencionados son sostenibles.
Disponibilidad de hardware y factores de forma
- Las unidades individuales de MI300X son difíciles/caras de conseguir; comúnmente se venden en cajas de 8 GPU por alrededor de ~€250k.
- Algunos afirman que se pueden encontrar módulos OAM individuales en mercados secundarios, pero sin backplanes/adaptadores son poco prácticos.
- Se destaca la MI350P como una opción PCIe más accesible (144 GB HBM), pero sigue orientada a servidores: refrigeración pasiva, alto consumo, necesita un flujo de aire serio o refrigeración personalizada.
- La discusión señala la realidad térmica de aceleradores de 600W+: se comportan como calefactores y pueden calentar significativamente una habitación.
Burbuja de IA, demanda y financiación
- Debate sobre si la inversión actual en IA es una burbuja.
- Un lado: billones en capex de IA financiados con deuda (~$3T citados de un artículo), con intereses que posiblemente superen los ingresos actuales de IA → insostenible salvo que la IA reemplace grandes cantidades de trabajo o provoque un cambio social radical.
- Contraargumentos: la demanda es “real y no va a desaparecer”; predicciones previas de “el estallido de la burbuja llegará pronto” fueron erróneas; los ingresos y el uso supuestamente se han disparado.
- Algunos distinguen entre demanda real y demanda dependiente de precios subvencionados; preocupa que la demanda pueda caer si se agota el capital barato.
Economía de inferencia y precios de DeepSeek
- Se discute el alquiler en la nube de una MI300X a ~$2/hora como quizá la forma más barata de ejecutar DeepSeek V4 Flash con pesos originales, pero los cálculos detallados sugieren márgenes ajustados o negativos frente a usar solo la API.
- El modelado del coste por token muestra que los tokens en caché son extremadamente baratos de servir si se implementan bien; los precios bajos de DeepSeek se justifican en parte por un fuerte reutilizado de caché en cargas de trabajo agénticas.
- Hay desacuerdo sobre si los laboratorios de frontera están obteniendo beneficios significativos: algunos sostienen que la inferencia por API es rentable con márgenes brutos positivos; otros dudan de que cubra los costes completos de I+D y entrenamiento.
- Se asume que DeepSeek opera cerca del coste y monetiza datos de usuario para entrenamiento futuro.
Autoalojamiento vs uso de API
- Varios argumentan que, dados la electricidad, la depreciación y el rendimiento, autoalojar rara vez es más barato que acceder por API para individuos.
- Otros enfatizan razones que no son de coste: privacidad, restricciones regulatorias, protección de IP, decodificación personalizada/dirigido de atención, y latencia y calidad más estables frente a endpoints comerciales muy batcheados.
- Para equipos, una sola MI300X o un pequeño clúster puede atender múltiples agentes de programación y cargas por lotes con fuertes garantías de privacidad.
Rendimiento y optimización
- El rendimiento reportado de la MI300X para DeepSeek V4 Flash (
150–800+ tok/s) se considera bueno pero aún por debajo del rendimiento reportado para H800 en el propio artículo DSpark de DeepSeek (15k tok/s/GPU). - Se señala que las configuraciones de múltiples GPU, bien conectadas en red y con paralelismo amplio, logran escalado superlineal del throughput, por lo que las cifras de una sola GPU no son comparables directamente.
- Algunos apuntan que las pilas basadas en NVIDIA (por ejemplo, usando sglang/dynamo) pueden lograr tasas de tokens por GPU mucho más altas; las pilas de AMD aún tienen margen de optimización.
Tamaño del modelo, MoE y ventana de contexto
- DeepSeek V4 Flash tiene ~284B parámetros totales (MoE) con cuantización MXFP4; otros modelos de frontera chinos se sitúan en el rango de 1.6T–2.8T.
- Los rumores sobre los tamaños de modelos de frontera estadounidenses van de 5T a 100T, y los participantes coinciden en que las cifras reales no están claras.
- Servir V4 Flash con la especificación completa (1M de contexto, múltiples usuarios) parece superar lo que una sola tarjeta de 144 GB puede manejar; algunos sugieren al menos dos MI350P.
- Se considera práctico un compromiso de contexto de 256k en MI300X; algunos usuarios informan que 1M de contexto es excesivo y que la pérdida de calidad en 256k es modesta.
Pila de software, datos y arte previo
- Se confirma que ROCm es utilizable para inferencia de frontera y, según informes, es usado por grandes laboratorios; algunos muestran interés en evitar capas superiores y hablar directamente con los buffers de comandos de hardware.
- Los datos de interacciones de usuarios (especialmente trazas de agentes, bases de código, sentimiento de usuario) se consideran muy valiosos para entrenamiento y ajuste fino por RL, incluso si son ruidosos.
- Se menciona trabajo previo como DwarfStar, que logra modelos similares con menos memoria, pero aún no ajustado para MI300X, lo que explica su ausencia en la sección de “arte previo” del repositorio.