Tesla pone en marcha un clúster Nvidia H100 de 10 mil nodos
El plan de Tesla de ejecutar un superordenador construido con 10.000 GPU Nvidia H100 está generando debate sobre cuán sustancial es realmente esta capacidad, tanto en escala como en costo, en comparación con las principales instalaciones en la nube y de HPC. Los comentaristas cuestionan si esto socava o complementa el esfuerzo interno de Tesla con hardware Dojo, y si las afirmaciones públicas de Musk sobre chips personalizados y los plazos de Full Self-Driving son realistas o en gran parte promocionales. Otros se centran en detalles técnicos como las métricas de FLOPS, las redes y los requisitos de energía, al tiempo que critican la escasa fuente del informe original, que se apoya en gran medida en un pequeño número de tuits entusiastas.
Alcance y definición de “Dojo” frente al clúster H100
- Hay confusión sobre la terminología: algunos usan “Dojo” para referirse a todo el cómputo de entrenamiento de ML de Tesla; otros insisten en que Dojo se refiere específicamente al superordenador con chips personalizados.
- El material citado indica que Tesla tiene ambas cosas: un sistema Dojo y un clúster de entrenamiento separado de 10.000 H100.
- Algunos sostienen que el “superordenador Dojo” no es real hasta que el hardware personalizado a gran escala esté operativo; otros dicen que los chips están en producción en TSMC con miles pedidos, así que llamarlo vaporware es inexacto.
Escala, costo e infraestructura
- Se describe a 10.000 H100 como un clúster muy grande, del mismo orden de magnitud que los superordenadores mejor clasificados; lo bastante grande para preentrenar LLMs de más de 100B parámetros.
- En comparación con operaciones históricas de minería de cripto (por ejemplo, 150k GPUs AMD antiguas), 10k parece menor en cantidad, pero mucho mayor por nodo y a nivel de sistema.
- Los comentaristas señalan que la cifra de 300M de dólares en GPU excluye costos importantes: almacenamiento, RAM, redes (enlaces de 400–800 Gbit), energía, refrigeración, racks, la construcción del centro de datos y el soporte de ingeniería del proveedor.
- Se caracteriza la oferta como limitada por Nvidia; se sugiere que los grandes compradores necesitan relaciones para asegurar hardware y NICs.
Fiabilidad de los informes y nivel de hype
- Varios consideran que la cobertura de TechRadar/Tom’s Hardware es “blogspam” de segunda mano, construida a partir de un solo tweet y redes sociales favorables a Tesla.
- Escepticismo sobre afirmaciones de marketing como “20x–30x de rendimiento”, y sobre si los 10k H100 están realmente instalados frente a pedidos o planificados, dadas las referencias en futuro y los límites globales de suministro de H100.
- Otros defienden las fuentes de redes sociales como canales de noticias de Tesla/SpaceX que suelen ser precisos, pero los críticos argumentan que los tuits por sí solos son una evidencia débil de despliegue.
Detalles técnicos y de HPC
- Debate sobre las métricas de rendimiento: el artículo y el marketing de Nvidia encabezan con PFLOPS FP64; algo inusual porque las GPU de consumo suelen tener FP64 más débil.
- Observaciones de que las operaciones INT8 no son “FLOPS”; deberían contarse como operaciones enteras o “TOPS”.
- Algunos discuten por qué el rendimiento de FP64 y FP32 sería igual; se especula que esto podría implicar decisiones de diseño que “lastran” FP32.
Contexto más amplio: Tesla, Musk y FSD
- Debate sobre si Tesla puede construir hardware de IA mejor que actores de IA más ricos y más establecidos.
- Opiniones divididas sobre Musk: alabado por facilitar cohetes reutilizables y popularizar los vehículos eléctricos; criticado por prometer de más (por ejemplo, plazos de robo-taxis/FSD), su estilo de gestión y su comportamiento público.
- Bromas de que, después de todo este cómputo, la conclusión podría ser que FSD todavía necesita lidar.