Apple 的新 SpeechAnalyzer API,与 Whisper 及其前身的基准测试表现

Apple 新的设备端 SpeechAnalyzer API 被报告为在标准英语基准上比 Apple 旧的 SFSpeechRecognizer 以及 OpenAI 的 Whisper Small 都要准确得多、速度更快,而且完全在近期的 iPhone 和 Mac 上本地运行。评论者认为这是隐私友好型转录和实时听写的一大进步,但也指出 Apple 的模型在多语言支持、diarization 和处理技术术语等方面仍落后于开源替代方案,而且它被锁定在 Apple 平台上并且权重封闭。许多人还质疑这项基准测试范围过窄,询问 SpeechAnalyzer 与 Nvidia 的 Parakeet、Nemotron、Mistral 的 Voxtral 以及 MOSS‑Transcribe‑Diarize 等更新的最先进模型相比如何,尤其是在嘈杂或非英语音频上的表现。

基准测试结果与范围

  • 新的 Apple SpeechAnalyzer API 在 LibriSpeech 测试集上的词错误率明显低于旧的 Apple SFSpeechRecognizer,并且在这项基准测试中准确率和速度都超过了 Whisper Small。
  • 该基准测试仅限英语、朗读语音(不是对话/会议)、单台 M2 Pro 机器,而且只与 Whisper Tiny/Base/Small 对比,没有比较更新或更大的模型。
  • 一些评论者认为这种提升令人印象深刻;另一些人则认为这项基准测试不完整或具有误导性,因为它排除了更强的基线。

与其他 ASR 模型的比较

  • 许多人认为 Whisper Small/Base/Tiny 已经“过时”,不再是最先进的;他们希望看到与以下模型的比较:
    • Whisper Large V2/V3/Turbo。
    • Nvidia Parakeet(TDT V2/V3、Unified、流式变体)。
    • Nvidia Nemotron、Mistral Voxtral、Cohere Transcribe、OpenAI Whisper V3 Turbo、ElevenLabs Scribe、MOSS‑Transcribe‑Diarize、Qwen ASR 等。
  • 有些人报告说,Whisper Large V2/V3 在困难或嘈杂音频上仍然最好;也有人声称像 Parakeet 或 MOSS 之类的新模型在他们自己的测试中优于 Whisper。
  • 还分享了几个 ASR 排行榜链接;有人说这些榜单更偏向新模型而不是 Whisper,不过个人经验各不相同。

设备端、隐私与平台问题

  • SpeechAnalyzer 在设备端运行,并在应用之间共享,避免了每个应用都捆绑大型模型,同时改善了 Apple 硬件上的功耗和散热表现。
  • 它不是开源权重;有些人认为这对隐私来说无妨(本地处理),也有人不信任 Apple,或者希望有可导出的模型用于 Linux/Home Assistant。
  • 人们也在询问哪些 iOS/macOS 版本和功能(键盘听写、Siri、语音备忘录)实际上使用了这个新引擎;一些报告称当前 Siri/听写即使在最近的 beta 中仍然感觉很差或很慢。

API 行为与开发者备注

  • 一个重要坑点:结束音频流还不够;必须调用 finalizeAndFinishThroughEndOfInput()(或等效方法),否则流式结果不会终止。
  • 旧的 SFSpeechRecognizer 默认会把音频发送到 Apple 服务器,除非明确强制使用设备端处理。
  • SpeechAnalyzer 支持流式部分结果、词级时间戳(英语)和说话人识别,但缺少内置的 diarization 和便捷的多语言处理;模型按语言下载。

现实世界用例与用户体验

  • 据报道的用途包括:播客和讲座转录、为听障用户提供实时字幕、语音备忘录、听写、编程工作流、历史档案以及 Home Assistant。
  • 许多人觉得 SpeechAnalyzer 在实践中又快又准,包括在混合质量音频上;但也有人在某些语言、口音或领域下仍然更喜欢自己现有的工具(例如基于 Parakeet 或 Whisper 的应用)。
  • 仍然存在对技术术语、口音(澳大利亚、德州、英国、纽约市)、语言自动检测,以及 Apple 历来对许多语言关注不足的担忧。