Whisper:Nvidia RTX 4090 对比 M1 Pro 与 MLX

围绕 Apple 的 M 系列芯片上使用新 MLX 框架运行 OpenAI Whisper 语音转文字模型的基准测试,引发了与 Nvidia RTX 4090 的比较,也带出了软件栈选择和优化程度会如何扭曲性能结果的问题。评论者指出,虽然使用 MLX 的 Mac 可能接近一个未优化的 4090 运行结果,但像“insanely-fast-whisper”这样的高度调优 CUDA 实现会让 4090 在实际中快得多。讨论最终形成的看法是:Apple Silicon 以很高的效率为 Mac 用户提供了不错的本地机器学习能力,但在严肃或大规模机器学习工作负载上,离 Nvidia 的高端方案仍然相差甚远。

基准测试的有效性与公平性

  • 许多人认为最初的对比值得怀疑:它在 RTX 4090 上使用了一个相对未优化的 Whisper 实现,而在 Apple Silicon 上使用了经过 MLX 调优的版本。
  • 重新用优化过的 CUDA 栈(例如 insanely-fast-whisper)跑测试的评论者表示,4090 大约比 Mac 的结果快 6–12 倍,而不是快约 16%。
  • 有几位指出,不同的 Whisper 库(OpenAI 基线、whisper.cpp、faster-whisper、ctranslate2、insanely-fast-whisper)差异可能高达数倍,因此跨平台说法很容易变成苹果和橘子的比较。
  • 有人认为,公平比较应当使用每个平台上最快可用的实现;也有人强调应匹配算法设置(如 batching、beam size),以避免偏差。

Whisper 实现与优化

  • 高度优化的 Nvidia 实现会使用 batching、自定义运行时、kernel fusion,以及 FlashAttention 或 BetterTransformer 等特性。
  • MLX 很新;它的 Whisper 示例被认为针对 Apple Silicon 做了优化,但还没有达到 CUDA 级别的“手工调优”深度。
  • whisper.cpp 和 CoreML/Metal 路径有 Apple 特定的优化(例如编码器在 ANE 上,解码器在 GPU/CPU 上)。
  • 当变化仅限于 batching 和 kernel 优化时,质量通常完全相同;量化或搜索简化可能会损害准确率。

硬件性能与架构

  • 共识是:RTX 4090(以及总体上的 Nvidia)在原始机器学习吞吐量上遥遥领先;M 系列“对一颗笔记本/桌面 SoC 来说很令人印象深刻”,但在高端领域并不真正具有竞争力。
  • 讨论还拆解了 Apple 和 Nvidia 架构中“core”、“ALU”、“shader”以及营销数字之间的差异。
  • 有人指出,不同模型类型对硬件的压力不同:LLM 往往受内存限制;扩散模型更偏算力限制;Whisper 也有其自身的性能特征。

功耗、成本与内存

  • Apple Silicon 往往能以低得多的功耗提供大块 GPU 性能,这对笔记本和 Vision Pro 之类设备很有价值。
  • 但也有人反驳说,如果按每瓦性能和每美元性能归一化,台式机中的 4090 看起来仍然更好,尤其是在你本来就拥有一台游戏 PC 的情况下。
  • Mac 上的统一内存为超出典型消费级 VRAM 限制的模型提供了更大的可寻址内存,但 GPU 显存带宽仍明显偏向高端 Nvidia 显卡。

生态、易用性与更广泛的背景

  • Nvidia 最大的优势是生态成熟度:CUDA、“开箱即用”的容器,以及大量高度优化的库。与之竞争的栈(Apple MLX、AMD ROCm、Intel)被描述为仍处在“先让它能工作起来”的早期阶段。
  • 一些用户觉得 MLX 的配置仍然比较粗糙;也有人报告说使用示例仓库很快就成功了。
  • 几位参与者以务实的方式概括了真正的选择:需要最大机器学习性能就用 Nvidia;如果便携性、效率或已有设备更重要,就用 Mac。