Google TPU v5p supera a Nvidia H100
Los nuevos aceleradores TPU v5p de Google se están comparando con los chips H100 y GH200 de Nvidia, y los comentaristas no solo examinan especificaciones brutas, sino también memoria, ancho de banda, eficiencia energética y coste total de propiedad a escala cloud. Muchos sostienen que la verdadera ventaja de Nvidia es su ecosistema de software CUDA y su amplia disponibilidad, mientras que los TPUs siguen vinculados a Google Cloud con soporte desigual de frameworks —especialmente para PyTorch—, lo que crea costes de cambio significativos. Otros señalan alternativas emergentes como AMD, Intel Gaudi y chips cloud personalizados, pero dudan de que alguna pueda ganar tracción sin igualar las herramientas maduras de Nvidia y su compatibilidad generalizada, especialmente para cargas de trabajo de entrenamiento de vanguardia.
Comparaciones de hardware (TPU v5p vs Nvidia H100/GH200)
- Varios comentarios sostienen que Google está “una generación por detrás”, señalando que el TPU v5p se compara con el H100 mientras Nvidia ya está anunciando GH200 y B100.
- Disputas sobre especificaciones brutas:
- TPU v5p: 95 GB de HBM por chip, ~2.7 TB/s de ancho de banda de memoria, 4,800 Gbps de interconexión por chip, topología de toro 3D.
- GH200: cifras controvertidas; algunos afirman 282 GB de HBM3e por “superchip”, otros aclaran que las hojas de datos muestran 96–144 GB por GPU y que 282 GB se refiere a configuraciones de doble GPU.
- Un ingeniero con aparente experiencia operativa con TPU aporta detalles de pods: 4 chips por host, 380 GB de HBM por host, “cubes” de 64 TPUs (~6 TB de HBM, ~29 PFLOPs bfloat16).
- Consenso: probablemente el GH200 supera al TPU v5p por chip, pero no por los márgenes enormes que sugieren algunas especificaciones mal citadas.
Coste, consumo y TCO
- Varios comentarios subrayan que el rendimiento por vatio y el coste total de propiedad (TCO) importan más que los FLOPs máximos.
- Los pods de TPU se describen como eficientes energéticamente frente a las GPU debido a un TDP menor y a una interconexión en toro que necesita menos enlaces y menos consumo.
- Un usuario afirma que el H100 entrega ~650 TFLOPs FP8, el TPU v5p ~400 TFLOPs INT8, y que el v5p es aproximadamente similar al Intel Gaudi2 y más barato que el H100 en relación precio/rendimiento.
- La cifra pública de Google de “2.1x value-for-money” se aclara como TPU v5p frente a TPU v4, no frente al H100.
CUDA, ecosistema de software y lock-in
- Un gran subhilo sostiene que la verdadera ventaja de Nvidia es CUDA y sus herramientas maduras, no el hardware bruto.
- Muchas bibliotecas de ML y kernels personalizados (p. ej., FlashAttention, DeepSpeed) son primero para CUDA; los backends no CUDA suelen ir por detrás.
- Algunos señalan que PyTorch, TensorFlow y JAX pueden apuntar a TPUs (vía XLA), pero otros dicen que PyTorch sobre TPU es frágil y más lento, con ops ausentes y problemas de carga de datos.
- La opinión general: para investigación de vanguardia y código de la comunidad, CUDA sigue siendo el camino de menor resistencia.
Acceso solo en la nube y papel de mercado de los TPUs
- Los TPUs solo están disponibles a través de Google Cloud; no puedes comprarlos y autoalojarlos de forma realista.
- Varios ven esto como un límite para su adopción, especialmente frente al hardware de Nvidia, que se vende ampliamente.
- Algunos sostienen que los TPUs se construyeron principalmente para reducir la dependencia de Google de proveedores externos y servir a cargas internas, no para ser un centro de beneficios independiente.
- Esto crea una preocupación de doble lock-in: cambiar el lock-in de Nvidia/CUDA por el lock-in de Google Cloud/TPU.
Experiencia de desarrollador y programabilidad
- Las opiniones divergen: algunos dicen que usar TPUs mediante TensorFlow/JAX es “sin dolor”; otros informan fragmentación de versiones entre servicios de GCP, ops no soportadas (p. ej., sparse tensors) y fuertes necesidades de refactorización.
- Cargas de trabajo no ML: los comentaristas dicen que los TPUs están profundamente especializados; para usarlos debes apuntar a XLA/HLO. Se sugiere JAX para experimentar, pero usar TPUs para cosas como ray tracing se considera un nicho.
Aceleradores competidores y panorama futuro
- Otros actores mencionados: AMD MI300, Intel Gaudi2/3, Cerebras, Tesla Dojo, Maia de Microsoft, además de Apple y varios ASICs de inferencia.
- Algunos creen que el dominio de Nvidia puede erosionarse en inferencia a medida que las arquitecturas de modelos comunes se estandarizan y los stacks no CUDA maduran.
- Otros argumentan que el entrenamiento seguirá siendo el principal cuello de botella estratégico, donde el ecosistema y las interconexiones de Nvidia la mantendrán dominante durante años.