Whisper: Nvidia RTX 4090 vs. M1 Pro con MLX

Los benchmarks del modelo de reconocimiento de voz Whisper de OpenAI en los chips M‑series de Apple usando el nuevo framework MLX provocaron comparaciones con una Nvidia RTX 4090, planteando dudas sobre cuánto sesgan los resultados la optimización y la elección de la pila de software. Los comentaristas señalan que, aunque un Mac con MLX puede acercarse a una ejecución no optimizada en una 4090, implementaciones basadas en CUDA altamente afinadas como “insanely-fast-whisper” hacen que la 4090 sea muchas veces más rápida en la práctica. El hilo converge en la idea de que Apple Silicon ofrece una eficiencia impresionante y una buena capacidad local de ML “gratuita” para quienes ya usan Mac, pero sigue estando muy por detrás del nivel alto de Nvidia para cargas de trabajo de aprendizaje automático serias o a gran escala.

Validez y equidad del benchmark

  • Muchos consideran cuestionable la comparación original: usó una implementación de Whisper relativamente no optimizada en la RTX 4090 frente a una versión ajustada para MLX en Apple Silicon.
  • Comentarios de quienes repitieron la prueba con una pila CUDA optimizada (por ejemplo, insanely-fast-whisper) informan que la 4090 resulta aproximadamente entre 6 y 12 veces más rápida que el resultado en Mac, no ~16% más rápida.
  • Varios señalan que distintas bibliotecas de Whisper (OpenAI baseline, whisper.cpp, faster-whisper, ctranslate2, insanely-fast-whisper) varían por factores muy grandes, así que las afirmaciones entre plataformas pueden convertirse fácilmente en comparaciones engañosas.
  • Algunos sostienen que una comparación justa debería usar la implementación más rápida disponible en cada plataforma; otros insisten en igualar los parámetros algorítmicos (batching, beam size) para evitar sesgos.

Implementaciones de Whisper y optimización

  • Las implementaciones de Nvidia altamente optimizadas usan batching, runtimes personalizados, fusionado de kernels y funciones como FlashAttention o BetterTransformer.
  • MLX es muy nuevo; su ejemplo de Whisper se considera optimizado para Apple Silicon, pero no “ajustado a mano” al nivel de CUDA.
  • whisper.cpp y las rutas CoreML/Metal tienen optimizaciones específicas de Apple (por ejemplo, encoder en ANE, decoder en GPU/CPU).
  • La calidad suele ser idéntica cuando solo cambian el batching y las optimizaciones de kernels; la cuantización o las simplificaciones de búsqueda pueden perjudicar la precisión.

Rendimiento y arquitectura del hardware

  • El consenso: RTX 4090 (y Nvidia en general) está muy por delante en rendimiento bruto de ML; la serie M es “impresionante para un SoC de portátil/escritorio”, pero no realmente competitiva en la gama alta.
  • La discusión separa “cores”, ALUs, shaders y cifras de marketing entre las arquitecturas de Apple y Nvidia.
  • Algunos señalan que distintos tipos de modelos exigen el hardware de manera diferente: los LLM suelen estar limitados por memoria; los modelos de difusión están más limitados por cómputo; Whisper tiene su propio perfil.

Energía, coste y memoria

  • Apple Silicon a menudo ofrece una buena parte del rendimiento de una GPU grande con mucha menos energía, algo valorado en portátiles y dispositivos como Vision Pro.
  • Otros responden que, normalizado por rendimiento por vatio y por dólar, una 4090 en un escritorio sigue viéndose mejor, especialmente si ya posees un PC para juegos.
  • La memoria unificada en Macs ofrece mucha RAM direccionable para modelos que superan los límites típicos de VRAM de consumo, pero el ancho de banda de memoria de GPU sigue favoreciendo claramente a las tarjetas Nvidia de gama alta.

Ecosistema, usabilidad y contexto más amplio

  • La mayor ventaja de Nvidia es la madurez del ecosistema: CUDA, contenedores que “simplemente funcionan” y muchas bibliotecas altamente optimizadas. Las pilas competidoras (Apple MLX, AMD ROCm, Intel) se describen como estando en una fase más temprana de “hacer que funcione”.
  • Algunos usuarios consideran que la configuración de MLX sigue siendo algo áspera; otros informan éxito rápido con repositorios de ejemplo.
  • Varios participantes enmarcan la elección real de forma pragmática: usar Nvidia para obtener el máximo rendimiento en ML; usar Macs donde la portabilidad, la eficiencia o la posesión previa sean lo principal.