WhisperSpeech – Um sistema de text-to-speech de código aberto construído invertendo o Whisper
Um projeto de código aberto chamado WhisperSpeech está usando o modelo de reconhecimento de fala Whisper da OpenAI ao contrário para criar text-to-speech de alta qualidade, com o objetivo de fechar a lacuna entre sistemas proprietários como ElevenLabs ou o próprio TTS da OpenAI e o que pode ser hospedado localmente. Os comentaristas exploram seus pontos fortes atuais (prosódia natural, clonagem de voz, desempenho em tempo real em GPUs, uso totalmente local/offline) junto com limitações como cobertura de idiomas, requisitos de computação e os desafios práticos de conjuntos de dados, ferramentas e incerteza legal em torno dos dados de treinamento. Comparações com outras soluções de TTS (Piper, Mimic, Azure, Google, EmotiVoice, Tortoise) destacam trade-offs entre qualidade, custo, latência e abertura, e ilustram como ainda é difícil transformar avanços rápidos em ML em produtos robustos para usuários finais.
Abordagem de treinamento e arquitetura
- Usa o encoder ASR multilíngue do Whisper como um front-end “semântico”, então o treinamento só precisa de áudio de fala; as transcrições são geradas automaticamente pelo Whisper.
- A arquitetura é descrita como: encoder do Whisper → tokens semânticos → tokens acústicos (do Encodec) → vocoder Vocos.
- Isso contorna encoders semânticos proprietários (por exemplo, em VALL-E/SPEAR-TTS) e permite expansão multilíngue se houver dados.
Recursos, clonagem de voz e ajustabilidade
- Suporta clonagem de voz a partir de um arquivo de áudio de referência (exemplo no notebook Colab, ainda não bem documentado no README).
- A identidade da voz é relativamente ajustável; prosódia e emoção ainda são difíceis de controlar e são uma área ativa de pesquisa.
- Pode converter fala existente para vozes diferentes via tokens derivados do Whisper; transferência de sotaque é especulada, mas ainda não foi testada.
Desempenho, hardware e implantação
- Funciona localmente; sem nuvem, sem rastreamento. Os pesos são baixados uma vez do Hugging Face.
- Em uma RTX 4090, foi relatado ~12× mais rápido que o tempo real; espera-se desempenho em tempo real para um “voice-bot” em GPUs NVIDIA modernas.
- A implementação atual é apenas CUDA/PyTorch; são desejadas portas para MLX e frameworks no estilo whisper.cpp/llama.cpp.
- Os modelos de inferência usam ~3 GB de VRAM em FP16 (2,3 GB em FP32, sugerindo espaço para otimização).
- Treinamento completo do zero: ~8 horas em 96 GPUs A100 para o modelo principal de TTS; modelos menores são mais rápidos. O fine-tuning é possível, mas ainda não é amigável para o usuário.
Suporte a idiomas e conjuntos de dados
- Atualmente suporta inglês e polonês; expansão multilíngue está planejada.
- Depende de audiolivros de alta qualidade (por exemplo, fontes de domínio público/CC como LibriVox, WolneLektury), além de conjuntos menores com emoções/prosódia variadas.
- A comunidade sugere corpora em mandarim e até alinhamentos forçados pré-computados; no geral, o gargalo é dado limpo e legalmente utilizável.
Comparações de qualidade
- Muitos comentaristas consideram o WhisperSpeech um dos melhores TTS de código aberto; alguns dizem que o Tortoise é ligeiramente melhor, mas muito mais lento.
- Em comparação com Mimic 3/Piper e EmotiVoice, vários observam que o WhisperSpeech soa mais natural; o inglês do EmotiVoice é descrito como um pouco não nativo.
- Comercialmente, o ElevenLabs é visto como de qualidade superior, mas muito caro; o TTS da OpenAI é quase tão bom e muito mais barato, e o Azure Neural/Google TTS têm qualidade inferior, mas tiers gratuitos generosos.
Licenciamento e preocupações legais
- O projeto enfatiza o uso de dados de fala devidamente licenciados (PD, CC-BY/SA) e código totalmente de código aberto para um uso comercial mais seguro.
- Surge debate sobre a expressão “devidamente licenciado”, já que os dados de treinamento do próprio Whisper não são claros; faz-se a distinção entre:
- Usar saídas do Whisper (licenciado sob MIT, não generativo) como features de entrada.
- Treinamento potencialmente problemático de modelos generativos em dados sem licença.
- Reconhece-se que mudanças legais futuras podem alterar o cenário de risco; a documentação sobre licenças dos conjuntos de dados está sendo melhorada.
Ecossistema, ferramentas e aplicações
- Há interesse em integrar o WhisperSpeech em:
- Plataformas sociais de VR para usuários baseados em texto.
- Aplicativos de tutoriais para desktop.
- Sistemas de chat/assistente que precisam de muitas vozes distintas.
- Discussões mais amplas observam:
- Progresso rápido de modelos versus productização lenta e dolorosa.
- Dores de ferramentas: dependências de GPU, scripts de instalação ruins e obstáculos de integração.
- Exemplos de sistemas de legendas/tradução ao vivo construídos sobre o Whisper; WhisperLive é mencionado como um projeto prático.