Tesla 启动 1 万节点 Nvidia H100 集群
Tesla 计划用 10,000 张 Nvidia H100 GPU 搭建一台超级计算机,这引发了关于其能力到底有多实在的争论,无论是规模还是成本,都与领先的云和 HPC 安装相比如何。评论者质疑这究竟是在削弱还是补充 Tesla 自家的 Dojo 硬件计划,以及 Musk 对定制芯片和 Full Self-Driving 时间表的公开说法究竟是现实可行,还是更多属于宣传。另一些人则聚焦于 FLOPS 指标、网络和供电需求等技术细节,同时批评原始新闻报道的来源过于单薄,过度依赖少数几条热情洋溢的推文。
“Dojo” 与 H100 集群的范围和定义
- 术语上存在混淆:有些人用“Dojo”来指 Tesla 的全部机器学习训练算力;也有人坚持 Dojo 特指那套定制芯片超级计算机。
- 引用材料显示 Tesla 两者都有:一套 Dojo 系统,以及一个独立的 10,000‑H100 训练集群。
- 有人认为,只有当大规模定制硬件真正上线后,“Dojo 超级计算机”才算名副其实;也有人说芯片已在 TSMC 量产且已下了数千颗订单,因此把它说成空中楼阁并不准确。
规模、成本与基础设施
- 10,000 张 H100 被描述为一个非常大的集群,规模与榜单前列的超级计算机处于同一数量级;足以预训练 1000 亿参数以上的 LLM。
- 与历史上的加密货币挖矿业务(例如 15 万块较旧的 AMD GPU)相比,1 万张在数量上感觉更少,但在单节点和系统层面要强大得多。
- 评论者指出,3 亿美元的 GPU 费用并不包括大量成本:存储、内存、网络(400–800 Gbit 连接)、供电、散热、机架、数据中心建设,以及厂商工程支持。
- 供应被描述为受 Nvidia 端瓶颈制约;有人建议,大买家需要关系资源才能确保拿到硬件和 NIC。
报道可信度与炒作程度
- 一些人认为 TechRadar/Tom’s Hardware 的报道只是基于一条推文和偏向 Tesla 的社交媒体内容拼凑出来的二手“blogspam”。
- 对“20x–30x 性能”之类的营销说法持怀疑态度,也怀疑在全球 H100 供应受限的情况下,1 万张 H100 到底是已部署、已订购,还是仅仅计划中,因为文章使用了将来时措辞。
- 也有人为这些社交媒体来源辩护,认为它们通常是 Tesla/SpaceX 新闻中相当准确的渠道,但批评者认为,仅凭推文不足以证明已经实际部署。
技术与 HPC 细节
- 关于性能指标存在讨论:文章和 Nvidia 的营销都以 FP64 PFLOPS 为主,这很不寻常,因为消费级 GPU 的 FP64 通常较弱。
- 有人挑剔 INT8 运算不应被称为“FLOPS”;应计为整数运算或“TOPS”。
- 也有人讨论为什么 FP64 和 FP32 吞吐量会相等;推测这可能意味着某些设计取舍会“拖累” FP32。
更广泛的背景:Tesla、Musk 与 FSD
- 争论的焦点之一是,Tesla 能否在 AI 硬件上胜过那些更富有、也更成熟的 AI 玩家。
- 对 Musk 的看法分化明显:有人称赞他推动了可重复使用火箭和电动车普及;也有人批评他过度承诺(例如 robo‑taxis/FSD 的时间表)、管理风格以及公开场合的行为。
- 还有人开玩笑说,折腾了这么多算力之后,结论也许还是:FSD 仍然需要 lidar。