Stable-Audio-Demo

Stability AI 的 Stable Audio 演示所生成的音乐与音效让许多人对其音频质量和节奏连贯性印象深刻,但听众也持续指出其存在“恐怖谷”感、奇怪的乐器约束,以及重复或缺乏方向感的音乐结构。评论者认为它在背景音乐和游戏音效方面短期内很有价值,但离人类水平的作曲或可编辑、可用于制作的成品歌曲仍相去甚远。帖子还凸显了人们对闭源权重和限制性许可的不满,以及围绕版权、训练数据和快速进步是否会停滞或很快追上专业人类输出的更广泛争论。

整体音频质量与“恐怖谷”

  • 许多听众说它“听起来像音乐”,但感觉不对劲:和弦进行怪异、缺乏类似人类的乐句表达,以及奇怪的乐器行为。
  • 吉他部分违反了真实演奏的物理约束(不可能的和弦指法、奇怪的调弦)。
  • 鼓独奏:节奏不错,但音色不真实且有伪影(镲片在击打过程中变化、鼓棒/鼓刷混淆、背景噪声)。
  • 有几位评论者提到低比特率 / “swishy” 的压缩式伪影,以及持续不断的混响。

按流派划分的表现

  • EDM / rave 风格曲目被评价为最强的输出之一,部分原因是这种流派能容忍重复和合成质感。
  • 冥想/氛围类作品被认为“还行”,因为这种流派本来就更偏重纹理和随机性。
  • 迪斯科以及和声更丰富的风格往往会生成怪异或不符合风格习惯的和弦进行。

与其他音乐模型的比较

  • 多位评论者认为,与之前的 SOTA(MusicGen、MusicLM)相比,它在连贯性和对提示词的跟随上更好。
  • 也有人认为像 Suno 这样的工具能生成更像人类创作的歌曲,并且具有更好的长期结构和和弦/旋律发展。
  • Stable Audio 常被描述为“不错的演示,但本质上还是个包装精美的循环库”。

控制、输入与编辑

  • 仅靠文本提示被认为对于严肃作曲来说过于粗糙。
  • 人们强烈期待:MIDI 输入、类似 ControlNet 的控制、类似 img2img 的“audio2audio”、哼唱到曲目的流水线,以及神经合成器/采样器混合方案。
  • 编辑被强调为一个核心未解决问题;大家希望有类似音频片段和 stems 的 in-painting 工具。

使用场景:音乐 vs 音效

  • 一些音乐人觉得这些音乐无聊、静态,缺乏过渡或发展。
  • 音效让一些人印象深刻,尤其适合原型开发和独立游戏,不过也有人觉得某些具体例子(例如脚步声)较弱。
  • 担忧:据说商业游戏使用需要 “enterprise” 许可证,这限制了小型开发者的吸引力。

访问、许可与知识产权

  • 没有公开权重;训练/推理代码已发布,但数据集没有。
  • 据说 StableAudio 的商业产品是在获得授权的内容上训练的,并通过库授权交易获取数据;有人推测,知识产权风险解释了为何权重关闭以及游戏许可更严格。
  • 该线程进一步展开为一场长篇、观点混杂的辩论,讨论版权、合理使用、在未获授权数据上训练、开源 ML 的可行性,以及未来可能的监管。

浏览器 / 实现说明

  • 网站警告不要使用 Safari;有人表示它“运行良好”,也有人提到 Safari 在处理大量 HTML audio 标签时有困难。