WhisperSpeech – Un sistema de texto a voz de código abierto construido invirtiendo Whisper

Un proyecto de código abierto llamado WhisperSpeech está usando el modelo de reconocimiento de voz Whisper de OpenAI al revés para crear texto a voz de alta calidad, con el objetivo de cerrar la brecha entre sistemas propietarios como ElevenLabs o el propio TTS de OpenAI y lo que se puede autohospedar. Los comentaristas exploran sus fortalezas actuales (prosodia natural, clonación de voz, rendimiento en tiempo real en GPUs, uso totalmente local/sin conexión) junto con limitaciones como la cobertura de idiomas, los requisitos de cómputo y los desafíos prácticos de los conjuntos de datos, las herramientas y la incertidumbre legal sobre los datos de entrenamiento. Las comparaciones con otras soluciones TTS (Piper, Mimic, Azure, Google, EmotiVoice, Tortoise) destacan las compensaciones entre calidad, coste, latencia y apertura, e ilustran lo difícil que sigue siendo convertir los rápidos avances en ML en productos robustos para el usuario final.

Enfoque de entrenamiento y arquitectura

  • Utiliza el codificador ASR multilingüe de Whisper como un front-end “semántico”, de modo que el entrenamiento solo necesita audio de voz; las transcripciones se generan automáticamente con Whisper.
  • La arquitectura se describe como: codificador de Whisper → tokens semánticos → tokens acústicos (de Encodec) → vocoder Vocos.
  • Esto evita codificadores semánticos propietarios (p. ej., en VALL-E/SPEAR-TTS) y permite la extensión multilingüe si existen datos.

Funciones, clonación de voz y ajustabilidad

  • Admite clonación de voz a partir de un archivo de audio de referencia (ejemplo en el notebook de Colab, aunque aún no está bien documentado en el README).
  • La identidad de la voz es relativamente ajustable; la prosodia y la emoción siguen siendo difíciles de controlar y son un área activa de investigación.
  • Puede convertir voz existente a diferentes voces mediante tokens derivados de Whisper; se especula con la transferencia de acento, pero aún no se ha probado.

Rendimiento, hardware y despliegue

  • Se ejecuta localmente; sin nube, sin seguimiento. Los pesos se descargan una sola vez desde Hugging Face.
  • En una RTX 4090, se informa de ~12× más rápido que en tiempo real; se espera rendimiento en tiempo real para un “voice-bot” en GPUs NVIDIA modernas.
  • La implementación actual es solo CUDA/PyTorch; se desean puertos a MLX y a marcos estilo whisper.cpp/llama.cpp.
  • Los modelos de inferencia usan ~3 GB de VRAM en FP16 (2,3 GB en FP32, lo que sugiere margen de optimización).
  • Entrenamiento completo desde cero: ~8 horas en 96 GPUs A100 para el modelo principal de TTS; los modelos más pequeños son más rápidos. El ajuste fino es posible, pero aún no es fácil de usar.

Compatibilidad de idiomas y conjuntos de datos

  • Actualmente admite inglés y polaco; se planifica una expansión multilingüe.
  • Depende de audiolibros de alta calidad (p. ej., fuentes de dominio público/CC como LibriVox, WolneLektury), además de conjuntos más pequeños con emociones/prosodia variadas.
  • La comunidad sugiere corpus de mandarín e incluso alineamientos forzados precalculados; en general, el cuello de botella son datos limpios y legalmente utilizables.

Comparaciones de calidad

  • Muchos comentaristas consideran WhisperSpeech uno de los mejores TTS de código abierto; algunos dicen que Tortoise es ligeramente mejor, pero mucho más lento.
  • Frente a Mimic 3/Piper y EmotiVoice, varios señalan que WhisperSpeech suena más natural; el inglés de EmotiVoice se describe como algo no nativo.
  • Comercialmente, ElevenLabs se ve como la mejor calidad, pero muy caro; el TTS de OpenAI es casi tan bueno y mucho más barato, mientras que Azure Neural/Google TTS tienen menor calidad pero ofrecen niveles gratuitos generosos.

Licencias y preocupaciones legales

  • El proyecto enfatiza el uso de datos de voz correctamente licenciados (PD, CC-BY/SA) y código completamente de código abierto para un uso comercial más seguro.
  • Surge un debate sobre la frase “correctamente licenciados” porque los datos de entrenamiento de Whisper no están claros; se distingue entre:
    • Usar las salidas de Whisper (con licencia MIT, no generativas) como características de entrada.
    • El entrenamiento potencialmente problemático de modelos generativos con datos sin licencia.
  • Se reconoce que futuros cambios legales podrían alterar el panorama de riesgos; la documentación sobre licencias de los conjuntos de datos está mejorando.

Ecosistema, herramientas y aplicaciones

  • Hay interés en integrar WhisperSpeech en:
    • Plataformas sociales de VR para usuarios basados en texto.
    • Aplicaciones de tutoriales de escritorio.
    • Sistemas de chat/asistentes que necesitan muchas voces distintas.
  • Una discusión más amplia señala:
    • Progreso rápido de modelos frente a una productización lenta y dolorosa.
    • Dolor en herramientas: dependencias de GPU, scripts de instalación deficientes y obstáculos de integración.
    • Ejemplos de sistemas de subtitulado/traducción en vivo construidos sobre Whisper; WhisperLive se menciona como un proyecto práctico.