La nueva API SpeechAnalyzer de Apple, comparada con Whisper y su predecesora

La nueva API SpeechAnalyzer de Apple, que funciona en el dispositivo, se está reportando como mucho más precisa y rápida que la antigua SFSpeechRecognizer de Apple e incluso que Whisper Small de OpenAI en benchmarks estándar en inglés, mientras se ejecuta totalmente de forma local en iPhones y Macs recientes. Los comentaristas ven esto como una gran victoria para la transcripción y el dictado en vivo con privacidad, pero señalan que el modelo de Apple aún queda por detrás de alternativas abiertas en áreas como el soporte multilingüe, la diarización y el manejo de jerga técnica, y que está limitado a las plataformas de Apple con pesos cerrados. Muchos también cuestionan la elección estrecha del benchmark y preguntan cómo se compara SpeechAnalyzer con modelos de última generación más nuevos como Parakeet de Nvidia, Nemotron, Voxtral de Mistral y MOSS‑Transcribe‑Diarize, especialmente para audio ruidoso o no inglés.

Resultados del benchmark y alcance

  • La nueva API SpeechAnalyzer de Apple muestra una tasa de error de palabras mucho menor que la antigua Apple SFSpeechRecognizer en los conjuntos de prueba de LibriSpeech, y supera a Whisper Small en precisión y velocidad en este benchmark.
  • El benchmark es solo en inglés, con voz leída (no conversaciones/reuniones), en una sola máquina M2 Pro, y solo compara con Whisper Tiny/Base/Small, no con modelos más nuevos o más grandes.
  • Algunos comentaristas consideran impresionante la mejora; otros desestiman el benchmark por incompleto o engañoso, ya que excluye baselines más fuertes.

Comparaciones con otros modelos ASR

  • Muchos sostienen que Whisper Small/Base/Tiny son “viejos” y ya no son el estado del arte; quieren comparaciones contra:
    • Whisper Large V2/V3/Turbo.
    • Nvidia Parakeet (TDT V2/V3, Unified, variantes de streaming).
    • Nvidia Nemotron, Mistral Voxtral, Cohere Transcribe, OpenAI Whisper V3 Turbo, ElevenLabs Scribe, MOSS‑Transcribe‑Diarize, Qwen ASR, etc.
  • Algunos informan que Whisper Large V2/V3 sigue siendo el mejor en audio difícil o ruidoso; otros afirman que modelos más nuevos como Parakeet o MOSS superan a Whisper en sus propias pruebas.
  • Se comparten varios enlaces a leaderboards de ASR; algunos dicen que favorecen a los modelos más nuevos sobre Whisper, aunque las experiencias anecdóticas varían.

En el dispositivo, privacidad y cuestiones de plataforma

  • SpeechAnalyzer se ejecuta en el dispositivo y se comparte entre apps, evitando empaquetar grandes modelos por app y mejorando el comportamiento energético/térmico en hardware de Apple.
  • No es de pesos abiertos; algunos ven eso como aceptable para la privacidad (procesamiento local), otros desconfían de Apple o quieren modelos exportables para Linux/Home Assistant.
  • Hay preguntas sobre qué versiones y funciones de iOS/macOS (dictado del teclado, Siri, Voice Memos) usan realmente este nuevo motor; varios informes dicen que Siri/dictado actuales siguen sintiéndose pobres o lentos, incluso en betas recientes.

Comportamiento de la API y notas para desarrolladores

  • Advertencia importante: terminar el flujo de audio no es suficiente; finalizeAndFinishThroughEndOfInput() (o su equivalente) debe llamarse o los resultados en streaming nunca terminan.
  • El antiguo SFSpeechRecognizer envía audio a los servidores de Apple a menos que se fuerce explícitamente el procesamiento en el dispositivo.
  • SpeechAnalyzer admite resultados parciales en streaming, marcas de tiempo a nivel de palabra (inglés) e identificación de hablantes, pero carece de diarización integrada y de un manejo multilingüe sencillo; los modelos se descargan por idioma.

Casos de uso reales y UX

  • Los usos reportados incluyen: transcripción de pódcast y conferencias, subtítulos en vivo para personas con pérdida auditiva, notas de voz, dictado, flujos de trabajo de programación, archivos históricos y Home Assistant.
  • Muchos encuentran SpeechAnalyzer rápido y preciso en la práctica, incluso con audio de calidad mixta; otros siguen prefiriendo sus herramientas existentes (por ejemplo, apps basadas en Parakeet o Whisper) para ciertos idiomas, acentos o dominios.
  • Persisten preocupaciones sobre jerga técnica, acentos (australiano, tejano, británico, NYC), autodetección de idioma y el histórico desinterés de Apple por muchos idiomas.