Whisper: Nvidia RTX 4090 vs. M1 Pro com MLX
Benchmarks do modelo de speech-to-text Whisper da OpenAI em chips da série M da Apple usando o novo framework MLX geraram comparações com uma Nvidia RTX 4090, levantando dúvidas sobre o quanto a otimização e a escolha da stack de software distorcem os resultados de desempenho. Comentadores observam que, embora um Mac com MLX possa se aproximar de uma execução não otimizada na 4090, implementações baseadas em CUDA altamente ajustadas, como “insanely-fast-whisper”, tornam a 4090 muitas vezes mais rápida na prática. O debate converge para a visão de que o Apple Silicon oferece eficiência impressionante e boa capacidade local de ML “gratuita” para quem já possui um Mac, mas ainda está longe do topo da Nvidia para cargas de trabalho sérias ou em larga escala de machine learning.
Validade e imparcialidade do benchmark
- Muitos consideram a comparação original questionável: ela usou uma implementação do Whisper relativamente pouco otimizada na RTX 4090 versus uma versão ajustada com MLX no Apple Silicon.
- Comentadores que refizeram o teste com uma stack CUDA otimizada (por exemplo, insanely‑fast‑whisper) relatam que a 4090 é cerca de 6–12× mais rápida do que o resultado no Mac, e não ~16% mais rápida.
- Vários observam que diferentes bibliotecas do Whisper (base OpenAI, whisper.cpp, faster‑whisper, ctranslate2, insanely‑fast‑whisper) variam por fatores grandes, então comparações entre plataformas podem facilmente virar comparação de laranjas com maçãs.
- Alguns argumentam que uma comparação justa deveria usar a implementação mais rápida disponível em cada plataforma; outros enfatizam corresponder as definições algorítmicas (batching, tamanho do beam) para evitar distorções.
Implementações do Whisper e otimização
- Implementações Nvidia altamente otimizadas usam batching, runtimes personalizados, fusão de kernels e recursos como FlashAttention ou BetterTransformer.
- MLX é muito novo; seu exemplo de Whisper é considerado otimizado para Apple Silicon, mas não “ajustado manualmente” com a mesma profundidade de CUDA.
- whisper.cpp e caminhos CoreML/Metal têm otimizações específicas da Apple (por exemplo, encoder na ANE, decoder na GPU/CPU).
- A qualidade normalmente é idêntica quando só batching e otimizações de kernel mudam; quantização ou simplificações de busca podem prejudicar a precisão.
Desempenho de hardware e arquitetura
- O consenso: a RTX 4090 (e a Nvidia em geral) está muito à frente em throughput bruto de ML; a série M é “impressionante para um SoC de laptop/desktop”, mas não é realmente competitiva no topo.
- A discussão separa “cores”, ALUs, shaders e números de marketing entre as arquiteturas da Apple e da Nvidia.
- Alguns observam que diferentes tipos de modelo pressionam o hardware de formas distintas: LLMs costumam ser limitados por memória; modelos de difusão, mais por computação; o Whisper tem seu próprio perfil.
Energia, custo e memória
- O Apple Silicon frequentemente entrega uma boa fração do desempenho de uma GPU grande com consumo de energia muito menor, o que é valorizado em laptops e dispositivos como o Vision Pro.
- Outros contrapõem que, normalizando por desempenho por watt e por dólar, uma 4090 em um desktop ainda parece melhor, especialmente se você já possui um PC gamer.
- A memória unificada nos Macs oferece uma RAM endereçável grande para modelos que excedem os limites típicos de VRAM de consumo, mas a largura de banda da memória da GPU ainda favorece fortemente as placas Nvidia de ponta.
Ecossistema, usabilidade e contexto mais amplo
- A maior vantagem da Nvidia é a maturidade do ecossistema: CUDA, containers que “simplesmente funcionam” e muitas bibliotecas altamente otimizadas. Pilhas concorrentes (Apple MLX, AMD ROCm, Intel) são descritas como estando numa fase anterior de “só fazer funcionar”.
- Alguns usuários ainda consideram a configuração do MLX meio áspera; outros relatam sucesso rápido com repositórios de exemplo.
- Vários participantes enquadram a escolha real de forma pragmática: use Nvidia para o máximo desempenho em ML; use Macs quando portabilidade, eficiência ou a posse já existente forem os fatores dominantes.