Google TPU v5p 击败 Nvidia H100
Google 新的 TPU v5p 加速器正被拿来与 Nvidia 的 H100 和 GH200 芯片比较,评论者不仅在讨论原始规格,还在关注云规模下的内存、带宽、功耗效率和总体拥有成本。许多人认为,Nvidia 的真正优势在于 CUDA 软件生态和广泛可获得性,而 TPU 仍绑定在 Google Cloud 上,对框架的支持并不均衡——尤其是 PyTorch——这带来了显著的迁移成本。也有人提到 AMD、Intel Gaudi 和定制云芯片等新竞争者,但质疑它们是否能在不匹配 Nvidia 成熟工具链和广泛兼容性的情况下获得 traction,尤其是在前沿训练工作负载上。
硬件对比(TPU v5p vs Nvidia H100/GH200)
- 多条评论认为 Google “落后一代”,指出 TPU v5p 被拿来与 H100 比较,而 Nvidia 已经在发布 GH200 和 B100。
- 原始规格存在争议:
- TPU v5p:每芯片 95 GB HBM,约 2.7 TB/s 内存带宽,每芯片 4,800 Gbps 互联,3D 环面拓扑。
- GH200:数据有争议;有人称每个“superchip”有 282 GB HBM3e,另一些人澄清规格表显示每个 GPU 为 96–144 GB,而 282 GB 指的是双 GPU 配置。
- 一位似乎有 TPU 运维经验的工程师给出了 pod 细节:每台主机 4 颗芯片,每台主机 380 GB HBM,64 颗 TPU 组成的“cubes”(约 6 TB HBM,约 29 PFLOPs bfloat16)。
- 共识是:GH200 在单芯片层面大概率优于 TPU v5p,但不会像某些误引规格所暗示的那样有巨大优势。
成本、功耗与 TCO
- 多条评论强调,性能/瓦特和总体拥有成本(TCO)比峰值 FLOPs 更重要。
- 由于更低的 TDP 和环面互联需要更少、也更不耗电的链路,TPU pod 被描述为比 GPU 更省电。
- 有用户称 H100 可提供约 650 TFLOPs FP8,TPU v5p 约 400 TFLOPs INT8,v5p 大致与 Intel Gaudi2 相近,且在价格/性能上比 H100 更便宜。
- Google 对外宣传的“2.1x 物有所值”说法被澄清为 TPU v5p 相对 TPU v4,而不是相对 H100。
CUDA、软件生态与锁定效应
- 一个较大的子线程认为,Nvidia 真正的护城河是 CUDA 及其成熟工具链,而不是原始硬件。
- 许多 ML 库和自定义 kernel(例如 FlashAttention、DeepSpeed)都优先面向 CUDA;非 CUDA 后端通常会落后。
- 有人指出 PyTorch、TensorFlow 和 JAX 可以通过 XLA 面向 TPU,但也有人说在 TPU 上跑 Pytorch 很脆弱且更慢,存在缺失算子和数据加载问题。
- 普遍看法是:对于前沿研究和社区代码,CUDA 仍然是阻力最小的路径。
仅限云端访问与 TPU 的市场角色
- TPU 只能通过 Google Cloud 使用;你无法现实地购买并自建部署。
- 许多人认为这限制了采用,尤其相较于广泛销售的 Nvidia 硬件。
- 有人认为 TPU 主要是为了减少 Google 对外部供应商的依赖并服务内部工作负载,而不是作为独立利润中心。
- 这带来了双重锁定担忧:从 Nvidia/CUDA 锁定,转向 Google Cloud/TPU 锁定。
开发体验与可编程性
- 观点分化:有人说通过 TensorFlow/JAX 使用 TPU “毫无痛苦”;也有人报告 GCP 各服务之间版本碎片化、算子不受支持(例如 sparse tensors)以及需要大量重构。
- 非 ML 工作负载:评论者表示 TPU 高度专用;要使用它们必须面向 XLA/HLO。JAX 被建议用于实验,但将 TPU 用于诸如光线追踪之类的任务被视为小众场景。
竞争加速器与未来格局
- 提到的其他参与者包括:AMD MI300、Intel Gaudi2/3、Cerebras、Tesla Dojo、Microsoft 的 Maia,以及 Apple 和各种推理 ASIC。
- 有人认为,随着常见模型架构标准化以及非 CUDA 栈成熟,Nvidia 在推理领域的主导地位可能会被削弱。
- 另一些人则认为训练仍将是主要的战略瓶颈,而 Nvidia 的生态与互联将在未来多年继续保持优势。