StyleTTS2 – Text To Speech de código aberto com qualidade Eleven Labs
Um modelo de texto para fala de código aberto chamado StyleTTS2 está chamando atenção por entregar vozes sintéticas rápidas e de alta qualidade, que alguns usuários veem como próximas de sistemas comerciais como o ElevenLabs, especialmente quando executado em GPUs de consumo. Os comentaristas exploram aspectos práticos como requisitos de hardware, configuração de Python/CUDA, suporte a idiomas e quão bem a ferramenta lida com áudio mais longo e clonagem de voz, com muitos observando que a qualidade da clonagem ainda fica atrás dos principais serviços pagos. O tópico também traz ambiguidades de licenciamento em torno dos pesos do modelo e preocupações mais amplas sobre uso indevido para golpes, além de entusiasmo por aplicações em assistentes locais de IA, jogos, audiolivros e agentes conversacionais.
Licenciamento e status de “código aberto”
- O código é licenciado sob MIT, mas os pesos pré-treinados vêm com condições extras: os usuários devem divulgar a síntese por IA, a menos que tenham permissão do dono da voz.
- Vários comentaristas argumentam que isso não é um MIT “puro” e torna o uso comercial arriscado ou ambíguo; outros observam que você pode evitar restrições treinando seus próprios modelos.
- Algumas pessoas se incomodam porque o repositório/anúncio não separa claramente a licença do código da licença do modelo.
Qualidade vs. ElevenLabs e outros TTS
- Muitos dizem que este é o melhor TTS de código aberto que já ouviram: prosódia natural, rápido e às vezes “melhor que o ground truth” em demonstrações.
- Outros percebem um tom metálico notável e dizem que ainda fica abaixo do ElevenLabs e do OpenAI TTS, especialmente para texto longo ou clonagem de voz.
- Alguns acham que o título do HN (“qualidade Eleven Labs”) é exagerado e editorializado.
Desempenho de clonagem de voz
- A clonagem de voz zero-shot é amplamente relatada como fraca: altura e cadência podem ser transferidas, mas o sotaque/timbre muitas vezes não, às vezes produzindo vozes genéricas ou com sotaque britânico.
- Comparado desfavoravelmente ao XTTSv2 e ao ElevenLabs; o próprio artigo dos autores supostamente reconhece que a clonagem ainda não é forte.
- As explicações se concentram na escala dos dados de treinamento (centenas vs. dezenas/centenas de milhares de horas).
Hardware, desempenho e configuração
- Modelos de ~700MB; a inferência pode ser mais rápida que o tempo real em GPUs (por exemplo, 15–95x RT em 4090; ~2x RT em laptop com CPU mais antiga).
- Funciona apenas com CPU, mas bem mais devagar; Raspberry Pi 4 fica em “minutos por enunciado”. Foi sugerido um TTS leve alternativo (por exemplo, Piper) para Pi.
- Alguns relatam que a instalação é trabalhosa (dependências, versões de CUDA, proliferação de venvs). Outros compartilham configurações funcionais passo a passo, recomendando mamba/conda ou Docker.
Casos de uso e integrações
- Forte interesse em:
- Assistentes conversacionais locais combinando StyleTTS2 + LLMs + Whisper.
- Pipelines de e-book/artigo → audiobook, incluindo serviços auto-hospedados.
- Diálogo de NPCs em jogos, narração dinâmica e modding (por exemplo, Skyrim, simuladores de golfe).
- Um usuário construiu um chatbot de voz local no Windows (Whisper + Mistral + StyleTTS2) com latência muito baixa e suporte à interrupção.
Suporte a idiomas
- Os modelos TTS pré-treinados principais são em inglês.
- Componentes auxiliares (ASR, extrator de pitch, BERT fonêmico) têm suporte multilíngue variável, mas TTS completo em outros idiomas atualmente requer treinamento extra.
Ética, segurança e empregos
- Alguns alertam para golpes e fraudes contra idosos por meio de clonagem de voz, defendendo apenas acesso via serviço e marca d’água.
- Outros argumentam que o abuso já está acontecendo com as ferramentas existentes e que a resposta certa é política/punições, não bloquear modelos.
- Há debate sobre o impacto em dubladores: alguns veem deslocamento de trabalho “commoditizado”; outros esperam novos mercados para vozes licenciadas e uso ampliado de intérpretes.