Show HN: मैंने एक 125M मॉडल को डिवाइस पर पियानो ऑटोकम्प्लीट करने के लिए ट्रेन किया
एक छोटा, 125M-parameter Transformer मॉडल जो iPhones पर चलता है, अब MIDI में live piano performances को autocomplete कर सकता है, और इतनी कम latency के साथ continuations उत्पन्न करता है कि व्यावहारिक उपयोग संभव है। टिप्पणीकार इसकी संगीत गुणवत्ता और सीमाओं—खासकर rhythm, structure, और accompaniment—पर चर्चा करते हैं, साथ ही multi-part backing tracks, musical attributes पर अधिक नियंत्रण, और इसे jamming partner या plugin के रूप में उपयोग करने जैसे विस्तार सुझाते हैं। यह प्रोजेक्ट AI की creativity में भूमिका पर व्यापक चिंतन भी उत्पन्न करता है: एक ओर संगीत अन्वेषण को तेज़ करने की इसकी क्षमता, और दूसरी ओर यह आशंका कि ऐसे टूल पारंपरिक practice और improvisation के मूल्य को कम कर सकते हैं।
समग्र प्रतिक्रिया और संभावित उपयोगिता
- कई टिप्पणीकारों को यह ऐप “जादुई,” प्रेरणादायक, और अन्य AI संगीत टूल्स की तुलना में असामान्य रूप से संगीतमय लगा।
- कई लोग इसे मज़े, आइडिया-जनरेशन, या लाइव परफॉर्मेंस के लिए synths या DAWs से जोड़ने की योजना बना रहे हैं।
- कुछ इसे एक बेहतरीन “HN-style” प्रोजेक्ट मानते हैं, जहाँ सीखने की यात्रा और implementation details उतनी ही दिलचस्प हैं जितना अंतिम परिणाम।
संगीत गुणवत्ता और व्यवहार
- श्रोताओं ने स्थानीय स्तर पर ठीक-ठाक coherence नोट की, लेकिन rhythm, form, और लंबी अवधि की संरचना में कमजोरियाँ भी देखीं; सुझावों में bar/measure tokens और higher-level planning शामिल हैं।
- कुछ लोगों को प्रसिद्ध रचनाओं (जैसे Für Elise) की AI continuations असहज लगीं; दूसरों को यह ताज़गीभरा और रचनात्मक रूप से विस्तृत लगा।
- एक टिप्पणीकार ने परिणामों की Markov models से प्रतिकूल तुलना की और तर्क दिया कि अधिक विश्वसनीय संगीत के लिए बेहतर structure-aware pipelines या datasets चाहिए।
- pitches के बीच संबंध absolute pitches से अधिक महत्वपूर्ण हो सकते हैं, ऐसी चर्चा भी हुई, जिससे interval-based representations का सुझाव मिला।
माँगे गए फीचर्स और उपयोग-परिदृश्य
- इनमें मजबूत रुचि दिखाई गई:
- बजाई गई melody या chord progression से real-time accompaniment (3–4 part, baroque या jazz style)।
- एक “jamming partner” जो दूसरे संगीतकार की तरह प्रतिक्रिया दे।
- on-device audio के बजाय (या उसके साथ) MIDI-out, जिसमें player pianos तक आउटपुट शामिल हो।
- Web MIDI, VST / Max for Live versions, और alternate drum patterns।
- microphone के जरिए input (whistling, acoustic piano)।
तकनीकी डिजाइन, डेटा, और प्रदर्शन
- मॉडल लगभग 125M parameters का है और उच्च note rates पर on-device चलता है; सबसे बड़ा speed gain एक अधिक compact note representation और compound events से आया।
- अतिरिक्त note attributes (velocity, duration, pedal, tempo, program changes) को NOTE events के fields के रूप में या अलग CONTROL events के रूप में model किया जा सकता है, हालांकि data consistency चिंता का विषय है।
- pretraining में कुछ सौ हज़ार MIDI files (~300M note events) इस्तेमाल हुए; DPO में ~700 preference examples थे और यह जल्दी train हुआ।
- inference optimizations मुख्यतः Core ML पर निर्भर हैं; आगे की गति-व्यवस्था और planning strategies (multiple continuations, automatic selection, chain-of-thought–like planning) roadmap पर हैं।
पिछले काम और संगीत अभ्यास से तुलना
- टिप्पणीकारों ने पहले के systems (Songsmith, Magenta Realtime, Continuator, Anticipatory Music Transformer) का उल्लेख किया और उनसे distillation तथा representation ideas सुझाए।
- ऐतिहासिक संदर्भ: classical training में अक्सर notation से ही “autocomplete”-style pattern continuation और high-level improvisation शामिल होती थी।
दार्शनिक और आलोचनात्मक दृष्टिकोण
- चर्चा की एक धारा इस बात को लेकर चिंतित थी कि AI accompaniment harmony, technique, और improvisation सीखने के आनंद और अनुशासन को कमज़ोर कर सकता है।
- अन्य लोगों का तर्क था कि ऐसे tools गंभीर अध्ययन को रोकते नहीं; वे toys या creative aids हैं, खासकर अब जब generation सस्ती हो गई है और “taste” व curation केंद्रीय हो जाते हैं।
- व्यापक चिंताएँ भी सामने आईं कि गहरे अभ्यास करने वाले लोगों और AI पर बहुत अधिक निर्भर रहने वालों के बीच सांस्कृतिक bifurcation हो सकती है, हालांकि कुछ लोगों ने इसे बढ़ा-चढ़ाकर बताया हुआ माना।