WhisperSpeech – Un sistema de texto a voz de código abierto construido invirtiendo Whisper
Un proyecto de código abierto llamado WhisperSpeech está usando el modelo de reconocimiento de voz Whisper de OpenAI al revés para crear texto a voz de alta calidad, con el objetivo de cerrar la brecha entre sistemas propietarios como ElevenLabs o el propio TTS de OpenAI y lo que se puede autohospedar. Los comentaristas exploran sus fortalezas actuales (prosodia natural, clonación de voz, rendimiento en tiempo real en GPUs, uso totalmente local/sin conexión) junto con limitaciones como la cobertura de idiomas, los requisitos de cómputo y los desafíos prácticos de los conjuntos de datos, las herramientas y la incertidumbre legal sobre los datos de entrenamiento. Las comparaciones con otras soluciones TTS (Piper, Mimic, Azure, Google, EmotiVoice, Tortoise) destacan las compensaciones entre calidad, coste, latencia y apertura, e ilustran lo difícil que sigue siendo convertir los rápidos avances en ML en productos robustos para el usuario final.
Enfoque de entrenamiento y arquitectura
- Utiliza el codificador ASR multilingüe de Whisper como un front-end “semántico”, de modo que el entrenamiento solo necesita audio de voz; las transcripciones se generan automáticamente con Whisper.
- La arquitectura se describe como: codificador de Whisper → tokens semánticos → tokens acústicos (de Encodec) → vocoder Vocos.
- Esto evita codificadores semánticos propietarios (p. ej., en VALL-E/SPEAR-TTS) y permite la extensión multilingüe si existen datos.
Funciones, clonación de voz y ajustabilidad
- Admite clonación de voz a partir de un archivo de audio de referencia (ejemplo en el notebook de Colab, aunque aún no está bien documentado en el README).
- La identidad de la voz es relativamente ajustable; la prosodia y la emoción siguen siendo difíciles de controlar y son un área activa de investigación.
- Puede convertir voz existente a diferentes voces mediante tokens derivados de Whisper; se especula con la transferencia de acento, pero aún no se ha probado.
Rendimiento, hardware y despliegue
- Se ejecuta localmente; sin nube, sin seguimiento. Los pesos se descargan una sola vez desde Hugging Face.
- En una RTX 4090, se informa de ~12× más rápido que en tiempo real; se espera rendimiento en tiempo real para un “voice-bot” en GPUs NVIDIA modernas.
- La implementación actual es solo CUDA/PyTorch; se desean puertos a MLX y a marcos estilo whisper.cpp/llama.cpp.
- Los modelos de inferencia usan ~3 GB de VRAM en FP16 (2,3 GB en FP32, lo que sugiere margen de optimización).
- Entrenamiento completo desde cero: ~8 horas en 96 GPUs A100 para el modelo principal de TTS; los modelos más pequeños son más rápidos. El ajuste fino es posible, pero aún no es fácil de usar.
Compatibilidad de idiomas y conjuntos de datos
- Actualmente admite inglés y polaco; se planifica una expansión multilingüe.
- Depende de audiolibros de alta calidad (p. ej., fuentes de dominio público/CC como LibriVox, WolneLektury), además de conjuntos más pequeños con emociones/prosodia variadas.
- La comunidad sugiere corpus de mandarín e incluso alineamientos forzados precalculados; en general, el cuello de botella son datos limpios y legalmente utilizables.
Comparaciones de calidad
- Muchos comentaristas consideran WhisperSpeech uno de los mejores TTS de código abierto; algunos dicen que Tortoise es ligeramente mejor, pero mucho más lento.
- Frente a Mimic 3/Piper y EmotiVoice, varios señalan que WhisperSpeech suena más natural; el inglés de EmotiVoice se describe como algo no nativo.
- Comercialmente, ElevenLabs se ve como la mejor calidad, pero muy caro; el TTS de OpenAI es casi tan bueno y mucho más barato, mientras que Azure Neural/Google TTS tienen menor calidad pero ofrecen niveles gratuitos generosos.
Licencias y preocupaciones legales
- El proyecto enfatiza el uso de datos de voz correctamente licenciados (PD, CC-BY/SA) y código completamente de código abierto para un uso comercial más seguro.
- Surge un debate sobre la frase “correctamente licenciados” porque los datos de entrenamiento de Whisper no están claros; se distingue entre:
- Usar las salidas de Whisper (con licencia MIT, no generativas) como características de entrada.
- El entrenamiento potencialmente problemático de modelos generativos con datos sin licencia.
- Se reconoce que futuros cambios legales podrían alterar el panorama de riesgos; la documentación sobre licencias de los conjuntos de datos está mejorando.
Ecosistema, herramientas y aplicaciones
- Hay interés en integrar WhisperSpeech en:
- Plataformas sociales de VR para usuarios basados en texto.
- Aplicaciones de tutoriales de escritorio.
- Sistemas de chat/asistentes que necesitan muchas voces distintas.
- Una discusión más amplia señala:
- Progreso rápido de modelos frente a una productización lenta y dolorosa.
- Dolor en herramientas: dependencias de GPU, scripts de instalación deficientes y obstáculos de integración.
- Ejemplos de sistemas de subtitulado/traducción en vivo construidos sobre Whisper; WhisperLive se menciona como un proyecto práctico.