Stable-Audio-Demo

La música y el sonido generados por IA en la demo Stable Audio de Stability AI impresionan a muchos por su calidad de audio y coherencia rítmica, pero los oyentes señalan de forma constante una sensación de “valle inquietante”, restricciones extrañas en los instrumentos y una estructura musical repetitiva o sin rumbo. Los comentaristas ven un valor a corto plazo para pistas de fondo y efectos de sonido para juegos, pero dicen que aún está lejos de la composición humana o de canciones editables y listas para producción. El hilo también destaca la frustración por los pesos cerrados y las licencias restrictivas, junto con debates más amplios sobre copyright, datos de entrenamiento y si el progreso rápido se estancará o pronto igualará la producción humana profesional.

Calidad general del audio y “valle inquietante”

  • Muchos oyentes dicen que “suena como música”, pero se siente raro: progresiones extrañas, falta de fraseo parecido al humano y comportamiento extraño de los instrumentos.
  • Las partes de guitarra violan restricciones físicas de la interpretación real (formas de acordes imposibles, afinaciones extrañas).
  • Solo de batería: buen tempo, pero timbres poco realistas y artefactos (cambios de platillos a mitad del golpe, confusión entre baqueta y escobilla, ruido de fondo).
  • Varios señalan artefactos de baja tasa de bits / tipo compresión “swishy” y reverberación constante.

Rendimiento según el género

  • Las pistas de EDM / estilo rave se valoran como el mejor resultado, en parte porque el género tolera la repetición y las texturas sintéticas.
  • Los trabajos de meditación/ambient se consideran “bien”, ya que ese género ya es pesado en textura y aleatoriedad.
  • Disco y estilos con mayor riqueza armónica suelen producir progresiones de acordes extrañas o poco idiomáticas.

Comparación con otros modelos de música

  • Varios comentaristas lo ven mejor que el SOTA anterior (MusicGen, MusicLM) en coherencia y en seguir indicaciones.
  • Otros piensan que herramientas como Suno producen canciones más parecidas a las humanas, con mejor estructura a largo plazo y desarrollo de acordes y melodía.
  • Stable Audio suele describirse como “buena demo, pero sigue siendo una biblioteca de loops glorificada”.

Control, entradas y edición

  • Se considera que el prompting solo con texto es demasiado burdo para una composición seria.
  • Hay un gran interés en: entrada MIDI, control estilo ControlNet, “audio2audio” tipo img2img, flujos de hummed-to-track y sintetizadores/samplers híbridos neuronales.
  • La edición se destaca como un problema central sin resolver; la gente quiere herramientas tipo in-painting para secciones de audio y stems.

Casos de uso: música vs efectos de sonido

  • Varios músicos encuentran la música aburrida, estática y sin transiciones ni desarrollo.
  • Los efectos de sonido impresionan a algunos, especialmente para prototipos y juegos indie, aunque otros consideran débiles ejemplos concretos (p. ej., pasos).
  • Preocupación: el uso comercial en juegos, al parecer, requiere una licencia “enterprise”, lo que limita su atractivo para pequeños desarrolladores.

Acceso, licencias e IP

  • No hay pesos públicos; se publica el código de entrenamiento/inferencia, pero no los datasets.
  • Se dice que el producto comercial de Stable Audio fue entrenado con contenido con licencia mediante un acuerdo de biblioteca; algunos especulan que el riesgo de IP explica los pesos cerrados y la licencia más estricta para juegos.
  • El hilo deriva en un largo debate con opiniones mixtas sobre copyright, fair use, entrenamiento con datos sin licencia, viabilidad del ML de código abierto y posible regulación futura.

Notas de navegador / implementación

  • El sitio advierte contra Safari; algunos informan que “funciona bien”, mientras que otros mencionan que Safari tiene problemas con muchas etiquetas HTML de audio.