La nueva API SpeechAnalyzer de Apple, comparada con Whisper y su predecesora
La nueva API SpeechAnalyzer de Apple, que funciona en el dispositivo, se está reportando como mucho más precisa y rápida que la antigua SFSpeechRecognizer de Apple e incluso que Whisper Small de OpenAI en benchmarks estándar en inglés, mientras se ejecuta totalmente de forma local en iPhones y Macs recientes. Los comentaristas ven esto como una gran victoria para la transcripción y el dictado en vivo con privacidad, pero señalan que el modelo de Apple aún queda por detrás de alternativas abiertas en áreas como el soporte multilingüe, la diarización y el manejo de jerga técnica, y que está limitado a las plataformas de Apple con pesos cerrados. Muchos también cuestionan la elección estrecha del benchmark y preguntan cómo se compara SpeechAnalyzer con modelos de última generación más nuevos como Parakeet de Nvidia, Nemotron, Voxtral de Mistral y MOSS‑Transcribe‑Diarize, especialmente para audio ruidoso o no inglés.
Resultados del benchmark y alcance
- La nueva API SpeechAnalyzer de Apple muestra una tasa de error de palabras mucho menor que la antigua Apple SFSpeechRecognizer en los conjuntos de prueba de LibriSpeech, y supera a Whisper Small en precisión y velocidad en este benchmark.
- El benchmark es solo en inglés, con voz leída (no conversaciones/reuniones), en una sola máquina M2 Pro, y solo compara con Whisper Tiny/Base/Small, no con modelos más nuevos o más grandes.
- Algunos comentaristas consideran impresionante la mejora; otros desestiman el benchmark por incompleto o engañoso, ya que excluye baselines más fuertes.
Comparaciones con otros modelos ASR
- Muchos sostienen que Whisper Small/Base/Tiny son “viejos” y ya no son el estado del arte; quieren comparaciones contra:
- Whisper Large V2/V3/Turbo.
- Nvidia Parakeet (TDT V2/V3, Unified, variantes de streaming).
- Nvidia Nemotron, Mistral Voxtral, Cohere Transcribe, OpenAI Whisper V3 Turbo, ElevenLabs Scribe, MOSS‑Transcribe‑Diarize, Qwen ASR, etc.
- Algunos informan que Whisper Large V2/V3 sigue siendo el mejor en audio difícil o ruidoso; otros afirman que modelos más nuevos como Parakeet o MOSS superan a Whisper en sus propias pruebas.
- Se comparten varios enlaces a leaderboards de ASR; algunos dicen que favorecen a los modelos más nuevos sobre Whisper, aunque las experiencias anecdóticas varían.
En el dispositivo, privacidad y cuestiones de plataforma
- SpeechAnalyzer se ejecuta en el dispositivo y se comparte entre apps, evitando empaquetar grandes modelos por app y mejorando el comportamiento energético/térmico en hardware de Apple.
- No es de pesos abiertos; algunos ven eso como aceptable para la privacidad (procesamiento local), otros desconfían de Apple o quieren modelos exportables para Linux/Home Assistant.
- Hay preguntas sobre qué versiones y funciones de iOS/macOS (dictado del teclado, Siri, Voice Memos) usan realmente este nuevo motor; varios informes dicen que Siri/dictado actuales siguen sintiéndose pobres o lentos, incluso en betas recientes.
Comportamiento de la API y notas para desarrolladores
- Advertencia importante: terminar el flujo de audio no es suficiente;
finalizeAndFinishThroughEndOfInput()(o su equivalente) debe llamarse o los resultados en streaming nunca terminan. - El antiguo SFSpeechRecognizer envía audio a los servidores de Apple a menos que se fuerce explícitamente el procesamiento en el dispositivo.
- SpeechAnalyzer admite resultados parciales en streaming, marcas de tiempo a nivel de palabra (inglés) e identificación de hablantes, pero carece de diarización integrada y de un manejo multilingüe sencillo; los modelos se descargan por idioma.
Casos de uso reales y UX
- Los usos reportados incluyen: transcripción de pódcast y conferencias, subtítulos en vivo para personas con pérdida auditiva, notas de voz, dictado, flujos de trabajo de programación, archivos históricos y Home Assistant.
- Muchos encuentran SpeechAnalyzer rápido y preciso en la práctica, incluso con audio de calidad mixta; otros siguen prefiriendo sus herramientas existentes (por ejemplo, apps basadas en Parakeet o Whisper) para ciertos idiomas, acentos o dominios.
- Persisten preocupaciones sobre jerga técnica, acentos (australiano, tejano, británico, NYC), autodetección de idioma y el histórico desinterés de Apple por muchos idiomas.