StyleTTS2 – texto a voz de código abierto con calidad de Eleven Labs

Un modelo de texto a voz de código abierto llamado StyleTTS2 está llamando la atención por ofrecer voces sintéticas rápidas y de alta calidad que algunos usuarios ven como cercanas a sistemas comerciales como ElevenLabs, especialmente cuando se ejecuta en GPUs de consumo. Los comentaristas exploran aspectos prácticos como los requisitos de hardware, la configuración de Python/CUDA, el soporte de idiomas y qué tan bien maneja el audio de larga duración y la clonación de voz, y muchos señalan que la calidad de clonación todavía queda por detrás de los servicios de pago líderes. El hilo también plantea ambigüedades de licencia en torno a los pesos del modelo y preocupaciones más amplias sobre el uso indebido para estafas, junto con entusiasmo por aplicaciones en asistentes de IA locales, juegos, audiolibros y agentes conversacionales.

Licencias y estado de “código abierto”

  • El código tiene licencia MIT, pero los pesos preentrenados vienen con condiciones adicionales: los usuarios deben revelar que la síntesis es de IA salvo que tengan permiso del propietario de la voz.
  • Varios comentaristas sostienen que esto no es una MIT “pura” y que hace riesgoso o ambiguo el uso comercial; otros señalan que se pueden evitar las restricciones entrenando tus propios modelos.
  • A algunas personas les molesta que el repositorio/anuncio no separe claramente la licencia del código de la licencia del modelo.

Calidad frente a ElevenLabs y otros TTS

  • Muchos dicen que este es el mejor TTS de código abierto que han oído: prosodia natural, rápido y, a veces, “mejor que el ground truth” en demos.
  • Otros detectan un tono metálico notable y dicen que todavía está por debajo de ElevenLabs y OpenAI TTS, especialmente para audio de larga duración o clonación de voz.
  • Algunos creen que el título de HN (“calidad Eleven Labs”) es exagerado y editorializa.

Rendimiento de clonación de voz

  • La clonación de voz zero-shot se reporta ampliamente como débil: el tono y la cadencia pueden transferirse, pero el acento y el timbre a menudo no, produciendo a veces voces genéricas o con acento británico.
  • Se compara desfavorablemente con XTTSv2 y ElevenLabs; al parecer, el propio artículo de los autores reconoce que la clonación aún no es fuerte.
  • Las explicaciones se centran en la escala de los datos de entrenamiento (cientos frente a decenas/centenares de miles de horas).

Hardware, rendimiento y configuración

  • Los modelos pesan ~700 MB; la inferencia puede ser más rápida que el tiempo real en GPUs (por ejemplo, 15–95x RT en una 4090; ~2x RT en un portátil con CPU antigua).
  • Funciona solo con CPU, pero mucho más lento; en una Raspberry Pi 4 son “minutos por enunciado”. Se sugieren alternativas ligeras de TTS (por ejemplo, Piper) para la Pi.
  • Algunos informan que la instalación es delicada (dependencias, versiones de CUDA, proliferación de venv). Otros comparten configuraciones paso a paso que funcionan y recomiendan mamba/conda o Docker.

Casos de uso e integraciones

  • Hay gran interés en:
    • Asistentes conversacionales locales que combinen StyleTTS2 + LLMs + Whisper.
    • Tuberías de ebook / artículo → audiolibro, incluidos servicios autoalojados.
    • Diálogo de NPCs en juegos, narración dinámica y modding (por ejemplo, Skyrim, simuladores de golf).
  • Un usuario construyó un chatbot de voz para Windows completamente local (Whisper + Mistral + StyleTTS2) con latencia muy baja y soporte de interrupción.

Soporte de idiomas

  • Los modelos TTS preentrenados principales están en inglés.
  • Los componentes auxiliares (ASR, extractor de tono, BERT de fonemas) tienen distinto soporte multilingüe, pero el TTS completo en idiomas no ingleses actualmente requiere entrenamiento adicional.

Ética, seguridad y empleos

  • Algunos advierten sobre estafas y fraudes a personas mayores mediante clonación de voz, y abogan por acceso solo como servicio y por watermarking.
  • Otros argumentan que el abuso ya ocurre con herramientas existentes y que la respuesta correcta es la política y las sanciones, no bloquear modelos.
  • Hay debate sobre el impacto en los actores de voz: algunos ven desplazamiento del trabajo “commodity”; otros esperan nuevos mercados para voces con licencia y un uso ampliado de intérpretes.