OpenVoice: Versatile Instant Voice Cloning
La herramienta de clonación instantánea de voz OpenVoice promete text-to-speech zero-shot con la voz de un hablante objetivo, impresionando a algunos usuarios pero recibiendo críticas mixtas sobre la calidad y la robustez en el mundo real. Los comentaristas examinan su licencia Creative Commons NonCommercial, las afirmaciones de marca de agua/detección y la tokenómica asociada, discutiendo si realmente cuenta como código abierto y quién puede lucrar legalmente con ella. Más allá de la licencia, el hilo contrapone usos de accesibilidad y creatividad —como recuperar voces para personas que las han perdido o automatizar el doblaje— con riesgos elevados de estafas, deepfakes y erosión de la confianza en los medios digitales.
Proyecto y disponibilidad
- Se comparten el repositorio de GitHub y el sitio de demostración; los checkpoints están alojados en S3.
- El README señala que el repositorio abierto es una aproximación de un sistema interno de mayor calidad (mejor calidad de audio, similitud, naturalidad y eficiencia).
Licencia y debate sobre lo “abierto”
- El código está bajo CC BY-NC 4.0, lo que prohíbe el uso comercial.
- Varios comentaristas argumentan que esto no es “código abierto” según los estándares de la OSI / “free cultural works” y que debería llamarse “source available”.
- Otros responden que “abierto” puede significar simplemente visible y modificable para fines no comerciales.
- Se plantean preocupaciones de que las cláusulas no comerciales constriñen sobre todo a usuarios pequeños/startups, no a actores maliciosos ni a grandes empresas.
Marca de agua y detección
- El README dice que la empresa “se reserva la capacidad de detectar si un audio fue generado por OpenVoice, con o sin marca de agua”.
- Algunos son escépticos de que esto sea técnicamente realista; el código expone una función
add_watermark, lo que sugiere que cualquier marca de agua obvia puede eliminarse.
Seguridad y preocupaciones sobre descargas
- Un subhilo debate “desarmar” enlaces ZIP directos como higiene de seguridad frente a “teatro de la seguridad”.
- La mayoría coincide en que simplemente descargar/abrir un ZIP desde Amazon conlleva poco riesgo; el verdadero peligro viene de ejecutar código, no del archivo en sí.
Calidad, comparaciones y experiencia práctica
- Los usuarios informan que el modelo abierto suena claramente sintético en la práctica, especialmente en prosodia/tempo.
- Algunos consideran que está afinado más para voces estilizadas/anime.
- Se mencionan comparaciones y alternativas: RVC (voice conversion), VITS, Tortoise‑TTS y forks más rápidos, xTTS, ElevenLabs, Audiobox de Meta, Apple “Personal Voice” y varios servicios comerciales de voice-banking.
Casos de uso e impacto social
- Casos de uso positivos:
- Accesibilidad y recuperación de voces perdidas (ELA, lesiones de cuerdas vocales).
- Juegos indie, cortometrajes, tutoriales, prompts telefónicos, corregir líneas equivocadas.
- Doblaje/traducción manteniendo las voces originales; entrenamiento de acento.
- Muchos temen que los daños dominen: estafas más fáciles, deepfakes, propaganda, suplantación de seres queridos o figuras públicas.
- Se debate si una tecnología así necesita un fuerte “beneficio neto” para estar justificada, frente a argumentos de inevitabilidad/compartición del conocimiento.
Fraude, autenticación y confianza
- Hay fuertes críticas a bancos y empresas financieras que usan “mi voz es mi contraseña” dado el estado actual de la clonación.
- Algunos ven esto como negligente; se mencionan cuestiones de GDPR/consentimiento, pero el desenlace no está claro.
- Preocupa más ampliamente que, a medida que audio/video se vuelven trivialmente falsificables, se erosionen la confianza digital y la realidad compartida, aunque otros sostienen que la gente se adaptará y confiará en nuevos métodos de verificación.
Reacciones sobre cripto/modelo de negocio
- La tokenómica asociada del proyecto, “$SHELL” (oferta de 1B, gran asignación para equipo/tesorería), provoca escepticismo y comentarios de “estafa/cripto”.
- Varios señalan que el hilo trata más del paper/la tecnología que de la plataforma MyShell en general, pero el modelo de tokens sigue influyendo en la percepción.