Apple का नया SpeechAnalyzer API, Whisper और उसके पूर्ववर्ती के मुकाबले बेंचमार्क किया गया
Apple का नया on‑device SpeechAnalyzer API standard English benchmarks पर Apple के पुराने SFSpeechRecognizer और यहाँ तक कि OpenAI के Whisper Small से भी कहीं अधिक accurate और तेज़ बताया जा रहा है, जबकि यह हाल के iPhones और Macs पर पूरी तरह local रूप से चलता है। टिप्पणीकार इसे privacy‑preserving transcription और live dictation के लिए एक बड़ी जीत मानते हैं, लेकिन ध्यान दिलाते हैं कि multilingual support, diarization, और technical jargon से निपटने जैसे क्षेत्रों में Apple का model अभी भी open alternatives से पीछे है, और यह Apple platforms तक सीमित closed weights के साथ आता है। कई लोग benchmark की संकीर्ण पसंद पर भी सवाल उठाते हैं, और पूछते हैं कि SpeechAnalyzer का मुकाबला Nvidia के Parakeet, Nemotron, Mistral के Voxtral, और MOSS‑Transcribe‑Diarize जैसे नए state‑of‑the‑art models से कैसा है, खासकर noisy या non‑English audio के लिए।
बेंचमार्क परिणाम और दायरा
- नया Apple SpeechAnalyzer API, LibriSpeech टेस्ट सेट्स पर पुराने Apple SFSpeechRecognizer की तुलना में बहुत कम word error rate दिखाता है, और इस बेंचमार्क में accuracy और speed दोनों में Whisper Small को मात देता है।
- बेंचमार्क केवल अंग्रेज़ी पर आधारित है, पढ़ा हुआ speech है (बातचीत/मीटिंग्स नहीं), एकल M2 Pro मशीन पर चलाया गया है, और केवल Whisper Tiny/Base/Small से तुलना करता है, नए या बड़े मॉडलों से नहीं।
- कुछ टिप्पणीकार इस सुधार को प्रभावशाली मानते हैं; अन्य इसे अपूर्ण या भ्रामक बताते हैं क्योंकि इसमें मजबूत baselines शामिल नहीं हैं।
अन्य ASR मॉडलों से तुलना
- कई लोगों का तर्क है कि Whisper Small/Base/Tiny “पुराने” हैं और अब state of the art नहीं हैं; वे इनसे तुलना चाहते हैं:
- Whisper Large V2/V3/Turbo.
- Nvidia Parakeet (TDT V2/V3, Unified, streaming variants).
- Nvidia Nemotron, Mistral Voxtral, Cohere Transcribe, OpenAI Whisper V3 Turbo, ElevenLabs Scribe, MOSS‑Transcribe‑Diarize, Qwen ASR, आदि।
- कुछ लोग बताते हैं कि कठिन या noisy audio पर Whisper Large V2/V3 अभी भी सबसे अच्छा है; अन्य का दावा है कि Parakeet या MOSS जैसे नए मॉडल उनके अपने tests में Whisper से बेहतर हैं।
- ASR leaderboards के कई links साझा किए गए हैं; कुछ कहते हैं कि वे Whisper की तुलना में नए मॉडलों को तरजीह देते हैं, हालांकि अनुभव अलग‑अलग हैं।
on‑device, privacy, और platform मुद्दे
- SpeechAnalyzer on‑device चलता है और apps के बीच shared है, जिससे हर app में बड़े models bundle करने की जरूरत नहीं रहती और Apple hardware पर power/thermal behavior बेहतर होता है।
- यह open‑weight नहीं है; कुछ लोग इसे privacy (local processing) के लिहाज़ से ठीक मानते हैं, जबकि अन्य Apple पर भरोसा नहीं करते या Linux/Home Assistant के लिए exportable models चाहते हैं।
- इस बारे में प्रश्न हैं कि कौन‑से iOS/macOS versions और features (keyboard dictation, Siri, Voice Memos) वास्तव में इस नए engine का उपयोग करते हैं; कई reports कहती हैं कि current Siri/dictation अभी भी खराब या धीमी लगती है, recent betas पर भी।
API behavior और developer notes
- एक महत्वपूर्ण gotcha: audio stream को समाप्त करना पर्याप्त नहीं है;
finalizeAndFinishThroughEndOfInput()(या समकक्ष) को कॉल करना पड़ता है, वरना streaming results कभी समाप्त नहीं होते। - पुराना SFSpeechRecognizer, यदि explicitly on‑device forced न किया जाए, तो audio Apple servers पर भेजता है।
- SpeechAnalyzer streaming partial results, word‑level timestamps (English), और speaker identification सपोर्ट करता है, लेकिन built‑in diarization और आसान multilingual handling की कमी है; models भाषा के हिसाब से डाउनलोड होते हैं।
वास्तविक उपयोग के मामले और UX
- रिपोर्ट किए गए उपयोगों में शामिल हैं: podcast और lecture transcription, hard‑of‑hearing users के लिए live subtitles, voice memos, dictation, coding workflows, historical archives, और Home Assistant।
- कई लोगों को SpeechAnalyzer व्यवहार में तेज़ और सटीक लगता है, mixed‑quality audio पर भी; जबकि अन्य कुछ languages, accents, या domains के लिए अपने मौजूदा tools (जैसे Parakeet‑based या Whisper‑based apps) को प्राथमिकता देते हैं।
- technical jargon, accents (Australian, Texan, British, NYC), language auto‑detection, और कई भाषाओं के प्रति Apple की ऐतिहासिक उपेक्षा को लेकर चिंताएँ बनी हुई हैं।