Stable-Audio-Demo

Música e som gerados por IA na demonstração Stable Audio da Stability AI impressionam muitos pela qualidade de áudio e coerência rítmica, mas os ouvintes notam consistentemente uma sensação de “uncanny valley”, restrições estranhas dos instrumentos e uma estrutura musical repetitiva ou sem direção. Comentários veem valor de curto prazo para faixas de fundo e efeitos sonoros de jogos, mas dizem que ainda está longe de composição em nível humano ou de músicas editáveis e prontas para produção. O tópico também destaca frustrações com pesos fechados e licenciamento restritivo, junto de debates mais amplos sobre copyright, dados de treinamento e se o progresso rápido vai estagnar ou em breve igualar a produção profissional humana.

Qualidade geral do áudio e “uncanny valley”

  • Muitos ouvintes dizem que “soa como música”, mas parece estranho: progressões peculiares, falta de fraseado parecido com o humano e comportamento estranho dos instrumentos.
  • Partes de guitarra violam restrições físicas da execução real (formas de acordes impossíveis, afinações estranhas).
  • Solo de bateria: bom andamento, mas timbres irrealistas e artefatos (pratos mudando no meio do golpe, confusão entre baqueta/escova, ruído de fundo).
  • Vários apontam artefatos de compressão de baixa taxa de bits / “swishy” e reverb constante.

Desempenho dependente do gênero

  • Faixas em estilo EDM / rave são avaliadas como a saída mais forte, em parte porque o gênero tolera repetição e texturas sintéticas.
  • Trabalhos de meditação/ambient são considerados “bons”, já que esse gênero já é pesado em textura e aleatoriedade.
  • Disco e estilos com mais riqueza harmônica frequentemente produzem progressões de acordes bizarras ou pouco idiomáticas.

Comparação com outros modelos de música

  • Vários comentaristas veem isso como melhor do que o SOTA anterior (MusicGen, MusicLM) em coesão e seguimento do prompt.
  • Outros acham que ferramentas como Suno produzem músicas mais parecidas com as humanas, com melhor estrutura de longo prazo e desenvolvimento de acordes/melodia.
  • Stable Audio é frequentemente descrito como “boa demonstração, mas ainda uma biblioteca de loops glorificada”.

Controle, entradas e edição

  • Prompt apenas em texto é visto como grosseiro demais para composição séria.
  • Forte interesse em: entrada MIDI, controle no estilo ControlNet, “audio2audio” semelhante a img2img, pipelines de humming-to-track e híbridos de sintetizador/sampler neural.
  • A edição é destacada como um problema central não resolvido; as pessoas querem ferramentas semelhantes a in-painting para seções de áudio e stems.

Casos de uso: música vs efeitos sonoros

  • Vários músicos consideram a música entediante, estática e sem transições ou desenvolvimento.
  • Efeitos sonoros impressionam alguns, especialmente para prototipagem e jogos indie, embora outros considerem exemplos específicos (por exemplo, passos) fracos.
  • Preocupação: uso comercial em jogos supostamente requer uma licença “enterprise”, limitando o apelo para pequenos desenvolvedores.

Acesso, licenciamento e IP

  • Não há pesos públicos; o código para treinamento/inferência foi divulgado, mas não os datasets.
  • Diz-se que o produto comercial da StableAudio foi treinado em conteúdo licenciado por meio de um acordo com uma biblioteca; alguns especulam que o risco de IP explica os pesos fechados e o licenciamento mais restritivo para jogos.
  • O tópico se divide em um longo debate, com opiniões mistas, sobre copyright, fair use, treinamento com dados sem licença, viabilidade de ML open source e possível regulação futura.

Notas de navegador / implementação

  • O site alerta contra o Safari; alguns relatam que “funciona bem”, outros mencionam o Safari tendo dificuldade com muitas tags HTML de áudio.