Midjourney AI को प्रशिक्षित करने के लिए उपयोग किए गए कलाकारों के डेटाबेस की आलोचना

Midjourney के prompt system से जुड़ी 16,000 कलाकारों के नामों की एक कथित लीक सूची ने इस चिंता को फिर से भड़का दिया है कि generative AI models बिना सहमति के copyrighted artwork पर कैसे प्रशिक्षित किए जाते हैं। टिप्पणीकार बहस करते हैं कि क्या AI-generated images को copyright मिलना चाहिए, “AI-assisted” और “AI-authored” कार्य में कैसे अंतर किया जाए, और क्या भविष्य का regulation वास्तव में कलाकारों की रक्षा करेगा या केवल बड़े platforms को मजबूत करेगा जो licensed datasets खरीद सकते हैं। कुछ इसे पिछले automation जैसी अपरिहार्य technological upheaval मानते हैं, जबकि अन्य का तर्क है कि ऐसे models जो training data को regurgitate कर सकते हैं, एक कानूनी और नैतिक सीमा पार करते हैं जिसे courts को अंततः संबोधित करना होगा.

एआई-जनित कार्यों के लिए कॉपीराइट की स्थिति

  • कई टिप्पणियाँ नोट करती हैं कि अमेरिका में, पूरी तरह एआई-जनित छवियों पर वर्तमान में कॉपीराइट नहीं मिल सकता; केवल मिश्रित कार्यों के मानव-निर्मित हिस्से संरक्षित होते हैं।
  • अन्य लोग जोर देते हैं कि यह विषय सूक्ष्म है: Copyright Office एआई-सहायता प्राप्त कार्यों के पंजीकरण की अनुमति देता है, जहाँ मानव योगदान पर्याप्त रूप से रचनात्मक हों, लेकिन ऐसे कार्यों की नहीं जहाँ एआई प्राथमिक लेखक हो।
  • इस पर बहस है कि क्या प्रॉम्प्ट-लेखन के साथ चयन/पुनरावृत्ति लेखन-स्वामित्व के लिए पर्याप्त है; कुछ इसे फोटोग्राफी या Photoshop जैसा मानते हैं, जबकि अन्य कहते हैं कि केवल एक प्रॉम्प्ट पर्याप्त नहीं है।
  • अस्पष्ट सीमाएँ: कितनी “touch-up” या editing किसी एआई-व्युत्पन्न छवि को कॉपीराइट योग्य बनाती है, यह अभी भी स्पष्ट नहीं है।

प्रवर्तन, पहचान, और provenance

  • कई लोगों को “no AI art” या “AI art is public domain” जैसा सार्वभौमिक नियम व्यावहारिक रूप से अप्रवर्तनीय लगता है, क्योंकि एआई आउटपुट का पता लगाना कठिन है, खासकर जब उसे संपादित किया गया हो।
  • प्रस्तावों में default को उलटना शामिल है (जब तक अन्यथा सिद्ध न हो, एआई मानें) और निर्माताओं से प्रक्रिया से जुड़े artefacts संभालकर रखने की माँग; आलोचक इसे अधिकांश कलाकारों के लिए बोझिल और अवास्तविक मानते हैं।
  • कुछ लोग डिजिटल art के लिए cryptographically authenticated editing histories का सुझाव देते हैं; अन्य बताते हैं कि इन्हें manipulated किया जा सकता है या विभिन्न media types पर लागू करना कठिन होगा।

प्रशिक्षण डेटा की वैधता और नैतिकता

  • इस पर तीखा मतभेद है कि copyrighted works पर प्रशिक्षण “fair use” के तहत वैध है या सीधी चोरी।
  • कुछ का तर्क है कि models compression जैसे हैं; infringement केवल तब होता है जब user verbatim regurgitation के लिए मजबूर करे। दूसरे जवाब देते हैं कि memorization research दिखाती है कि models प्रभावी रूप से संरक्षित works को store करते हैं, जिससे weights स्वयं infringing बन जाते हैं।
  • इस पर बहस है कि outputs कितने अर्थपूर्ण रूप से “derivative” हैं, लाखों training items के बीच value को कैसे atribue किया जाए, और क्या artists को royalties मिलनी चाहिए।

Midjourney कलाकार सूची के विशिष्ट बिंदु

  • कई टिप्पणीकार नोट करते हैं कि 16,000-कलाकारों की सूची वास्तविक training set नहीं है, बल्कि एक post-hoc सूची है (Wikipedia जैसे स्रोतों से scraped), जिसका उपयोग style prompts को optimize करने के लिए किया गया।
  • Midjourney को व्यापक रूप से “everything” पर प्रशिक्षित बताया जाता है, न कि केवल उन कलाकारों पर, हालांकि इस तरह की व्यापक scraping की भी आलोचना की जाती है।

आर्थिक और नीतिगत निहितार्थ

  • कुछ लोगों का मानना है कि open models और permissive jurisdictions के फैलाव के कारण यह लड़ाई पहले ही हार चुकी है; अन्य Napster/Spotify को उदाहरण मानते हैं कि कानून और licensing practices को बदल सकते हैं।
  • चिंता जताई गई है कि सख्त IP rules बड़े incumbents के पक्ष में जाएँगे, जो विशाल licensed datasets खरीद सकते हैं, और इससे शक्ति और अधिक केंद्रीकृत होगी।
  • ऐतिहासिक automation (Luddites, mechanical looms) से तुलना की गई; इस पर असहमति बनी हुई है कि क्या यह एक समान technological shift है या फिर विशेष रूप से exploitative है क्योंकि इसके लिए बड़े पैमाने पर बिना सहमति copying की गई थी।