StyleTTS2 – 开源的、接近 Eleven Labs 质量的文本转语音
一个名为 StyleTTS2 的开源文本转语音模型正在引发关注,因为它能生成快速、高质量的合成语音,一些用户认为它在消费级 GPU 上运行时已经接近 ElevenLabs 之类的商业系统。评论者讨论了硬件需求、Python/CUDA 配置、语言支持,以及该工具在长篇音频和声音克隆方面的表现;许多人指出,克隆质量仍落后于领先的付费服务。帖子还暴露出围绕模型权重许可的含糊之处,以及对被滥用于诈骗的更广泛担忧,同时也对其在本地 AI 助手、游戏、有声书和对话代理中的应用充满热情。
许可和“开源”状态
- 代码采用 MIT 许可,但预训练权重附带额外条件:用户必须披露音频是 AI 合成的,除非他们获得了声音所有者的许可。
- 一些评论者认为这并不是“纯粹”的 MIT,而且会让商业使用变得有风险或含糊;另一些人指出,你可以通过自行训练模型来避开这些限制。
- 也有人对仓库/公告没有清楚地区分代码许可与模型许可感到不满。
质量与 ElevenLabs 及其他 TTS 的比较
- 许多人表示,这是他们听过的最好的开源 TTS:韵律自然、速度快,而且在演示中有时甚至“比真值还好”。
- 也有人觉得存在明显的金属感,并表示它仍不如 ElevenLabs 和 OpenAI TTS,尤其是在长篇文本或声音克隆方面。
- 一些人认为 HN 标题(“Eleven Labs quality”)夸张且带有评论性。
声音克隆表现
- 零样本声音克隆被普遍认为较弱:音高和节奏可能能迁移,但口音/音色通常不行,有时会生成普通化或带英国口音的声音。
- 与 XTTSv2 和 ElevenLabs 相比表现不佳;作者自己的论文据称也承认当前克隆能力还不强。
- 解释主要集中在训练数据规模上(数百小时 vs. 数万/数十万小时)。
硬件、性能与安装
- 模型约 700MB;在 GPU 上推理可快于实时(例如 4090 上 15–95x RT;旧款 CPU 笔记本上约 2x RT)。
- 仅 CPU 也能运行,但速度慢得多;Raspberry Pi 4 上则是“每句要几分钟”。有人建议在 Pi 上改用更轻量的 TTS(如 Piper)。
- 有些人反馈安装很折腾(依赖、CUDA 版本、venv 过多)。也有人分享了可行的逐步安装方法,并推荐使用 mamba/conda 或 Docker。
使用场景与集成
- 许多人对以下用途很感兴趣:
- 将 StyleTTS2 + LLM + Whisper 结合的本地对话助手。
- 电子书/文章 → 有声书流水线,包括自托管服务。
- 游戏 NPC 对话、动态旁白和 Mod 制作(例如 Skyrim、高尔夫模拟器)。
- 有一位用户做了一个完全本地的 Windows 语音聊天机器人(Whisper + Mistral + StyleTTS2),延迟很低,并支持打断。
语言支持
- 核心预训练 TTS 模型是英语。
- 辅助组件(ASR、pitch extractor、phoneme BERT)对多语言的支持各不相同,但完整的非英语 TTS 目前仍需要额外训练。
伦理、安全与就业
- 有人警告声音克隆会被用于诈骗和针对老年人的欺诈,主张只通过服务方式提供访问并加入水印。
- 也有人认为,现有工具已经在被滥用,而应对方式应该是政策/惩罚,而不是封锁模型。
- 讨论还涉及对配音演员的影响:有人认为会挤压“商品化”工作;也有人预计,授权声音的新市场和表演者用途的扩大将出现。