WhisperSpeech – Um sistema de text-to-speech de código aberto construído invertendo o Whisper

Um projeto de código aberto chamado WhisperSpeech está usando o modelo de reconhecimento de fala Whisper da OpenAI ao contrário para criar text-to-speech de alta qualidade, com o objetivo de fechar a lacuna entre sistemas proprietários como ElevenLabs ou o próprio TTS da OpenAI e o que pode ser hospedado localmente. Os comentaristas exploram seus pontos fortes atuais (prosódia natural, clonagem de voz, desempenho em tempo real em GPUs, uso totalmente local/offline) junto com limitações como cobertura de idiomas, requisitos de computação e os desafios práticos de conjuntos de dados, ferramentas e incerteza legal em torno dos dados de treinamento. Comparações com outras soluções de TTS (Piper, Mimic, Azure, Google, EmotiVoice, Tortoise) destacam trade-offs entre qualidade, custo, latência e abertura, e ilustram como ainda é difícil transformar avanços rápidos em ML em produtos robustos para usuários finais.

Abordagem de treinamento e arquitetura

  • Usa o encoder ASR multilíngue do Whisper como um front-end “semântico”, então o treinamento só precisa de áudio de fala; as transcrições são geradas automaticamente pelo Whisper.
  • A arquitetura é descrita como: encoder do Whisper → tokens semânticos → tokens acústicos (do Encodec) → vocoder Vocos.
  • Isso contorna encoders semânticos proprietários (por exemplo, em VALL-E/SPEAR-TTS) e permite expansão multilíngue se houver dados.

Recursos, clonagem de voz e ajustabilidade

  • Suporta clonagem de voz a partir de um arquivo de áudio de referência (exemplo no notebook Colab, ainda não bem documentado no README).
  • A identidade da voz é relativamente ajustável; prosódia e emoção ainda são difíceis de controlar e são uma área ativa de pesquisa.
  • Pode converter fala existente para vozes diferentes via tokens derivados do Whisper; transferência de sotaque é especulada, mas ainda não foi testada.

Desempenho, hardware e implantação

  • Funciona localmente; sem nuvem, sem rastreamento. Os pesos são baixados uma vez do Hugging Face.
  • Em uma RTX 4090, foi relatado ~12× mais rápido que o tempo real; espera-se desempenho em tempo real para um “voice-bot” em GPUs NVIDIA modernas.
  • A implementação atual é apenas CUDA/PyTorch; são desejadas portas para MLX e frameworks no estilo whisper.cpp/llama.cpp.
  • Os modelos de inferência usam ~3 GB de VRAM em FP16 (2,3 GB em FP32, sugerindo espaço para otimização).
  • Treinamento completo do zero: ~8 horas em 96 GPUs A100 para o modelo principal de TTS; modelos menores são mais rápidos. O fine-tuning é possível, mas ainda não é amigável para o usuário.

Suporte a idiomas e conjuntos de dados

  • Atualmente suporta inglês e polonês; expansão multilíngue está planejada.
  • Depende de audiolivros de alta qualidade (por exemplo, fontes de domínio público/CC como LibriVox, WolneLektury), além de conjuntos menores com emoções/prosódia variadas.
  • A comunidade sugere corpora em mandarim e até alinhamentos forçados pré-computados; no geral, o gargalo é dado limpo e legalmente utilizável.

Comparações de qualidade

  • Muitos comentaristas consideram o WhisperSpeech um dos melhores TTS de código aberto; alguns dizem que o Tortoise é ligeiramente melhor, mas muito mais lento.
  • Em comparação com Mimic 3/Piper e EmotiVoice, vários observam que o WhisperSpeech soa mais natural; o inglês do EmotiVoice é descrito como um pouco não nativo.
  • Comercialmente, o ElevenLabs é visto como de qualidade superior, mas muito caro; o TTS da OpenAI é quase tão bom e muito mais barato, e o Azure Neural/Google TTS têm qualidade inferior, mas tiers gratuitos generosos.

Licenciamento e preocupações legais

  • O projeto enfatiza o uso de dados de fala devidamente licenciados (PD, CC-BY/SA) e código totalmente de código aberto para um uso comercial mais seguro.
  • Surge debate sobre a expressão “devidamente licenciado”, já que os dados de treinamento do próprio Whisper não são claros; faz-se a distinção entre:
    • Usar saídas do Whisper (licenciado sob MIT, não generativo) como features de entrada.
    • Treinamento potencialmente problemático de modelos generativos em dados sem licença.
  • Reconhece-se que mudanças legais futuras podem alterar o cenário de risco; a documentação sobre licenças dos conjuntos de dados está sendo melhorada.

Ecossistema, ferramentas e aplicações

  • Há interesse em integrar o WhisperSpeech em:
    • Plataformas sociais de VR para usuários baseados em texto.
    • Aplicativos de tutoriais para desktop.
    • Sistemas de chat/assistente que precisam de muitas vozes distintas.
  • Discussões mais amplas observam:
    • Progresso rápido de modelos versus productização lenta e dolorosa.
    • Dores de ferramentas: dependências de GPU, scripts de instalação ruins e obstáculos de integração.
    • Exemplos de sistemas de legendas/tradução ao vivo construídos sobre o Whisper; WhisperLive é mencionado como um projeto prático.