Show HN:我训练了一个 125M 模型,可在设备端自动补全钢琴演奏
一个在 iPhone 上运行的、仅 125M 参数的小型 Transformer 模型,如今可以用 MIDI 实时自动补全现场钢琴演奏,生成的续写延迟低到足以实际使用。评论者讨论了它的音乐质量与局限——尤其是节奏、结构和伴奏方面——并提出了多声部伴奏、更丰富的音乐属性控制,以及将其用作即兴搭档或插件等扩展方向。这个项目也引发了更广泛的思考:AI 在创造力中的角色,既包括它加速音乐探索的潜力,也包括人们对这类工具可能削弱传统练习与即兴价值的担忧。
整体反响与被感知的潜力
- 许多评论者觉得这个应用“很神奇”、令人振奋,而且与其他 AI 音乐工具相比,音乐性出乎意料地强。
- 一些人计划把它接到合成器或 DAW 上,用于娱乐、灵感发散或现场演出。
- 也有人认为这是很典型的“HN 风格”项目:学习过程和实现细节和最终成果一样有趣。
音乐质量与行为
- 听者指出它在局部连贯性上还不错,但在节奏、结构,以及更长程的组织上存在弱点;有人建议加入小节/拍号 token 和更高层次的规划。
- 有些人觉得 AI 继续演奏知名曲目(例如《Für Elise》)会让人不安;另一些人则觉得这很新鲜,也更具创造性。
- 一位评论者将结果与 Markov 模型作了不太有利的比较,并认为要做出更有说服力的音乐,需要更了解结构的管线或数据集。
- 讨论中还提到,音高之间的关系可能比绝对音高更重要,因此可以考虑基于音程的表示。
请求的功能与使用场景
- 大家强烈感兴趣的方向包括:
- 根据演奏出的旋律或和弦进行,实时生成 3–4 声部伴奏(巴洛克或爵士风格)。
- 一个会像另一位乐手那样回应的“即兴搭档”。
- MIDI 输出,代替或补充设备端音频,包括用于自动演奏钢琴。
- Web MIDI、VST / Max for Live 版本,以及不同的鼓点模式。
- 通过麦克风输入(口哨、原声钢琴)。
技术设计、数据与性能
- 该模型约有 125M 参数,可在设备端以很高的音符速率运行;最大的速度提升来自更紧凑的音符表示和复合事件。
- 额外的音符属性(力度、时值、踏板、速度、乐器程序切换)可以建模为 NOTE 事件上的字段,或作为独立的 CONTROL 事件,但数据一致性是个问题。
- 预训练使用了几十万 MIDI 文件(约 3 亿个音符事件);DPO 使用了约 700 个偏好示例,并且训练很快。
- 推理优化主要依赖 Core ML;进一步的速度提升与规划策略(多路续写、自动选择、类似 chain-of-thought 的规划)已列入路线图。
与既有工作和音乐实践的比较
- 评论者提到了早期系统(Songsmith、Magenta Realtime、Continuator、Anticipatory Music Transformer),并建议借鉴其中的蒸馏和表示方法。
- 历史背景:古典训练往往涉及类似“自动补全”的模式延续,以及仅根据乐谱进行高层即兴。
哲学与批评视角
- 一种讨论担心,AI 伴奏会削弱学习和理解和声、技巧与即兴演奏所带来的乐趣与纪律性。
- 也有人认为这类工具并不会妨碍认真学习;它们更像玩具或创意辅助,尤其是在如今生成成本很低、而“品味”和策展变得更核心的情况下。
- 还出现了更广泛的担忧:社会可能分化为一部分人深度练习技能,另一部分人高度依赖 AI;不过也有人认为这种担忧有些过头。