StyleTTS2 – texto a voz de código abierto con calidad de Eleven Labs
Un modelo de texto a voz de código abierto llamado StyleTTS2 está llamando la atención por ofrecer voces sintéticas rápidas y de alta calidad que algunos usuarios ven como cercanas a sistemas comerciales como ElevenLabs, especialmente cuando se ejecuta en GPUs de consumo. Los comentaristas exploran aspectos prácticos como los requisitos de hardware, la configuración de Python/CUDA, el soporte de idiomas y qué tan bien maneja el audio de larga duración y la clonación de voz, y muchos señalan que la calidad de clonación todavía queda por detrás de los servicios de pago líderes. El hilo también plantea ambigüedades de licencia en torno a los pesos del modelo y preocupaciones más amplias sobre el uso indebido para estafas, junto con entusiasmo por aplicaciones en asistentes de IA locales, juegos, audiolibros y agentes conversacionales.
Licencias y estado de “código abierto”
- El código tiene licencia MIT, pero los pesos preentrenados vienen con condiciones adicionales: los usuarios deben revelar que la síntesis es de IA salvo que tengan permiso del propietario de la voz.
- Varios comentaristas sostienen que esto no es una MIT “pura” y que hace riesgoso o ambiguo el uso comercial; otros señalan que se pueden evitar las restricciones entrenando tus propios modelos.
- A algunas personas les molesta que el repositorio/anuncio no separe claramente la licencia del código de la licencia del modelo.
Calidad frente a ElevenLabs y otros TTS
- Muchos dicen que este es el mejor TTS de código abierto que han oído: prosodia natural, rápido y, a veces, “mejor que el ground truth” en demos.
- Otros detectan un tono metálico notable y dicen que todavía está por debajo de ElevenLabs y OpenAI TTS, especialmente para audio de larga duración o clonación de voz.
- Algunos creen que el título de HN (“calidad Eleven Labs”) es exagerado y editorializa.
Rendimiento de clonación de voz
- La clonación de voz zero-shot se reporta ampliamente como débil: el tono y la cadencia pueden transferirse, pero el acento y el timbre a menudo no, produciendo a veces voces genéricas o con acento británico.
- Se compara desfavorablemente con XTTSv2 y ElevenLabs; al parecer, el propio artículo de los autores reconoce que la clonación aún no es fuerte.
- Las explicaciones se centran en la escala de los datos de entrenamiento (cientos frente a decenas/centenares de miles de horas).
Hardware, rendimiento y configuración
- Los modelos pesan ~700 MB; la inferencia puede ser más rápida que el tiempo real en GPUs (por ejemplo, 15–95x RT en una 4090; ~2x RT en un portátil con CPU antigua).
- Funciona solo con CPU, pero mucho más lento; en una Raspberry Pi 4 son “minutos por enunciado”. Se sugieren alternativas ligeras de TTS (por ejemplo, Piper) para la Pi.
- Algunos informan que la instalación es delicada (dependencias, versiones de CUDA, proliferación de venv). Otros comparten configuraciones paso a paso que funcionan y recomiendan mamba/conda o Docker.
Casos de uso e integraciones
- Hay gran interés en:
- Asistentes conversacionales locales que combinen StyleTTS2 + LLMs + Whisper.
- Tuberías de ebook / artículo → audiolibro, incluidos servicios autoalojados.
- Diálogo de NPCs en juegos, narración dinámica y modding (por ejemplo, Skyrim, simuladores de golf).
- Un usuario construyó un chatbot de voz para Windows completamente local (Whisper + Mistral + StyleTTS2) con latencia muy baja y soporte de interrupción.
Soporte de idiomas
- Los modelos TTS preentrenados principales están en inglés.
- Los componentes auxiliares (ASR, extractor de tono, BERT de fonemas) tienen distinto soporte multilingüe, pero el TTS completo en idiomas no ingleses actualmente requiere entrenamiento adicional.
Ética, seguridad y empleos
- Algunos advierten sobre estafas y fraudes a personas mayores mediante clonación de voz, y abogan por acceso solo como servicio y por watermarking.
- Otros argumentan que el abuso ya ocurre con herramientas existentes y que la respuesta correcta es la política y las sanciones, no bloquear modelos.
- Hay debate sobre el impacto en los actores de voz: algunos ven desplazamiento del trabajo “commodity”; otros esperan nuevos mercados para voces con licencia y un uso ampliado de intérpretes.