Stable-Audio-Demo
La música y el sonido generados por IA en la demo Stable Audio de Stability AI impresionan a muchos por su calidad de audio y coherencia rítmica, pero los oyentes señalan de forma constante una sensación de “valle inquietante”, restricciones extrañas en los instrumentos y una estructura musical repetitiva o sin rumbo. Los comentaristas ven un valor a corto plazo para pistas de fondo y efectos de sonido para juegos, pero dicen que aún está lejos de la composición humana o de canciones editables y listas para producción. El hilo también destaca la frustración por los pesos cerrados y las licencias restrictivas, junto con debates más amplios sobre copyright, datos de entrenamiento y si el progreso rápido se estancará o pronto igualará la producción humana profesional.
Calidad general del audio y “valle inquietante”
- Muchos oyentes dicen que “suena como música”, pero se siente raro: progresiones extrañas, falta de fraseo parecido al humano y comportamiento extraño de los instrumentos.
- Las partes de guitarra violan restricciones físicas de la interpretación real (formas de acordes imposibles, afinaciones extrañas).
- Solo de batería: buen tempo, pero timbres poco realistas y artefactos (cambios de platillos a mitad del golpe, confusión entre baqueta y escobilla, ruido de fondo).
- Varios señalan artefactos de baja tasa de bits / tipo compresión “swishy” y reverberación constante.
Rendimiento según el género
- Las pistas de EDM / estilo rave se valoran como el mejor resultado, en parte porque el género tolera la repetición y las texturas sintéticas.
- Los trabajos de meditación/ambient se consideran “bien”, ya que ese género ya es pesado en textura y aleatoriedad.
- Disco y estilos con mayor riqueza armónica suelen producir progresiones de acordes extrañas o poco idiomáticas.
Comparación con otros modelos de música
- Varios comentaristas lo ven mejor que el SOTA anterior (MusicGen, MusicLM) en coherencia y en seguir indicaciones.
- Otros piensan que herramientas como Suno producen canciones más parecidas a las humanas, con mejor estructura a largo plazo y desarrollo de acordes y melodía.
- Stable Audio suele describirse como “buena demo, pero sigue siendo una biblioteca de loops glorificada”.
Control, entradas y edición
- Se considera que el prompting solo con texto es demasiado burdo para una composición seria.
- Hay un gran interés en: entrada MIDI, control estilo ControlNet, “audio2audio” tipo img2img, flujos de hummed-to-track y sintetizadores/samplers híbridos neuronales.
- La edición se destaca como un problema central sin resolver; la gente quiere herramientas tipo in-painting para secciones de audio y stems.
Casos de uso: música vs efectos de sonido
- Varios músicos encuentran la música aburrida, estática y sin transiciones ni desarrollo.
- Los efectos de sonido impresionan a algunos, especialmente para prototipos y juegos indie, aunque otros consideran débiles ejemplos concretos (p. ej., pasos).
- Preocupación: el uso comercial en juegos, al parecer, requiere una licencia “enterprise”, lo que limita su atractivo para pequeños desarrolladores.
Acceso, licencias e IP
- No hay pesos públicos; se publica el código de entrenamiento/inferencia, pero no los datasets.
- Se dice que el producto comercial de Stable Audio fue entrenado con contenido con licencia mediante un acuerdo de biblioteca; algunos especulan que el riesgo de IP explica los pesos cerrados y la licencia más estricta para juegos.
- El hilo deriva en un largo debate con opiniones mixtas sobre copyright, fair use, entrenamiento con datos sin licencia, viabilidad del ML de código abierto y posible regulación futura.
Notas de navegador / implementación
- El sitio advierte contra Safari; algunos informan que “funciona bien”, mientras que otros mencionan que Safari tiene problemas con muchas etiquetas HTML de audio.