A nova API SpeechAnalyzer da Apple, comparada com Whisper e sua predecessora

A nova API SpeechAnalyzer da Apple, que roda no dispositivo, está sendo relatada como muito mais precisa e rápida do que o antigo SFSpeechRecognizer da Apple e até do que o Whisper Small da OpenAI em benchmarks padrão de inglês, enquanto opera inteiramente localmente em iPhones e Macs recentes. Os comentaristas veem isso como um grande avanço para transcrição e ditado ao vivo com foco em privacidade, mas observam que o modelo da Apple ainda fica atrás de alternativas abertas em áreas como suporte multilíngue, diarização e tratamento de jargão técnico, além de estar preso às plataformas da Apple com pesos fechados. Muitos também questionam a escolha restrita do benchmark, perguntando como o SpeechAnalyzer se compara a modelos mais novos e avançados, como o Parakeet da Nvidia, o Nemotron, o Voxtral da Mistral e o MOSS‑Transcribe‑Diarize, especialmente para áudio ruidoso ou não inglês.

Resultados do benchmark e escopo

  • A nova API SpeechAnalyzer da Apple mostra uma taxa de erro de palavras muito menor do que o antigo Apple SFSpeechRecognizer nos conjuntos de teste do LibriSpeech, e supera o Whisper Small em precisão e velocidade neste benchmark.
  • O benchmark é apenas em inglês, fala lida (não conversas/reuniões), em uma única máquina M2 Pro, e compara apenas com Whisper Tiny/Base/Small, não com modelos mais novos ou maiores.
  • Alguns comentaristas consideram a melhoria impressionante; outros descartam o benchmark como incompleto ou enganoso porque exclui bases de comparação mais fortes.

Comparações com outros modelos de ASR

  • Muitos argumentam que Whisper Small/Base/Tiny são “antigos” e já não são o estado da arte; eles querem comparações contra:
    • Whisper Large V2/V3/Turbo.
    • Nvidia Parakeet (TDT V2/V3, Unified, variantes streaming).
    • Nvidia Nemotron, Mistral Voxtral, Cohere Transcribe, OpenAI Whisper V3 Turbo, ElevenLabs Scribe, MOSS‑Transcribe‑Diarize, Qwen ASR, etc.
  • Alguns relatam que Whisper Large V2/V3 ainda é o melhor em áudio difícil ou ruidoso; outros afirmam que modelos mais novos como Parakeet ou MOSS superam o Whisper em seus próprios testes.
  • Vários links para rankings de ASR são compartilhados; alguns dizem que eles favorecem modelos mais novos em vez do Whisper, embora as experiências anedóticas variem.

Uso no dispositivo, privacidade e questões de plataforma

  • O SpeechAnalyzer roda no dispositivo e é compartilhado entre apps, evitando empacotar grandes modelos por aplicativo e melhorando o comportamento de energia/temperatura no hardware da Apple.
  • Ele não é open-weight; alguns veem isso como aceitável para privacidade (processamento local), outros desconfiam da Apple ou querem modelos exportáveis para Linux/Home Assistant.
  • Há dúvidas sobre quais versões do iOS/macOS e quais recursos (digitação por teclado, Siri, Voice Memos) realmente usam esse novo mecanismo; vários relatos dizem que a Siri/digitação atuais ainda parecem ruins ou lentas, mesmo em betas recentes.

Comportamento da API e notas para desenvolvedores

  • Um detalhe importante: encerrar o fluxo de áudio não é suficiente; finalizeAndFinishThroughEndOfInput() (ou equivalente) precisa ser chamado, ou os resultados em streaming nunca terminam.
  • O antigo SFSpeechRecognizer envia áudio para os servidores da Apple, a menos que seja forçado explicitamente a rodar no dispositivo.
  • O SpeechAnalyzer suporta resultados parciais em streaming, timestamps por palavra (inglês) e identificação de falante, mas não tem diarização integrada nem tratamento multilíngue fácil; os modelos são baixados por idioma.

Casos de uso reais e UX

  • Os usos relatados incluem: transcrição de podcasts e palestras, legendas ao vivo para pessoas com deficiência auditiva, memorandos de voz, ditado, fluxos de trabalho de programação, arquivos históricos e Home Assistant.
  • Muitos consideram o SpeechAnalyzer rápido e preciso na prática, inclusive em áudio de qualidade mista; outros ainda preferem suas ferramentas existentes (por exemplo, apps baseados em Parakeet ou Whisper) para certos idiomas, sotaques ou domínios.
  • Persistem preocupações sobre jargão técnico, sotaques (australiano, texano, britânico, de NYC), detecção automática de idioma e o histórico descaso da Apple com muitos idiomas.