Microsoft executive ने AI scraping को 'मानव इतिहास में श्रम की सबसे बड़ी चोरी' कहा
एक unsealed court filing, जिसमें एक Microsoft executive ने AI training को “मानव इतिहास में श्रम की सबसे बड़ी चोरी” कहा, ने इस बहस को भड़का दिया है कि scraped web content पर बने बड़े language models चोरी, copyright infringement, या transformative fair use क्या हैं। Commenters human learning, piracy, और ऐतिहासिक slavery की analogies पर भिड़ते हैं; वे tech firms की hypocrisy पर भी चर्चा करते हैं, जो कभी piracy के ख़िलाफ़ लड़ी थीं लेकिन अब copyrighted works को बड़े पैमाने पर ingest कर रही हैं। साथ ही, वे individuals के infringement पर दंडित होने और corporations के पुरस्कृत होने के असंतुलन की ओर इशारा करते हैं। कई लोगों का तर्क है कि भले training कानूनी हो, यह creative work का मूल्य घटाती है, शक्ति को कुछ AI vendors में केंद्रित करती है, और benefits को public की ओर संतुलित करने के लिए नए taxation, royalties, या open-weight mandates को उचित ठहरा सकती है.
क्या AI training “चोरी” है या सिर्फ़ copyright infringement?
- कई लोग तर्क देते हैं कि training के लिए scraping “श्रम की सबसे बड़ी चोरी” है: models बिना consent या भुगतान के लाखों works से value निकाल लेते हैं, फिर creators से ही प्रतिस्पर्धा करते हैं।
- दूसरे लोग ज़ोर देते हैं कि strict sense में यह “चोरी” नहीं है: original काम वैसे के वैसे रहते हैं, copying अधिकतम copyright infringement है, और क़ानून परंपरागत रूप से copies की रक्षा करता है, “ideas/facts/patterns” की नहीं।
- एक बार-बार आने वाला counterpoint: किताबों से human learning legal है; विरोधी जवाब देते हैं कि एक non-rival human mind, commercial use में लगाए गए massively scalable machine learner की तरह नहीं होती।
- कानूनी स्थिति को अभी भी अनिश्चित बताया गया है: कुछ courts ने training के कुछ पहलुओं को fair use माना है; fair use बनाम market harm अब भी केंद्रीय और विवादित है।
Scale, automation, और double standards
- Commenters इस बात पर ज़ोर देते हैं कि scale सब कुछ बदल देता है: एक व्यक्ति द्वारा pirating बनाम corporations द्वारा web को साफ़ कर लेना, paywalled और यहाँ तक कि pirated datasets तक, फिर outputs से कमाई करना।
- कई लोग hypocrisy की ओर इशारा करते हैं: individuals को piracy के लिए भारी सज़ा मिली है; जबकि AI labs वही काम बड़े पैमाने पर करके भी trillion-dollar valuations पा रहे हैं।
- Labs की model “distillation theft” संबंधी शिकायतों को विशेष रूप से hypocritical माना जाता है, क्योंकि उनके अपने models unlicensed material पर trained हैं।
Creators, culture, और labor पर प्रभाव
- Strong चिंता है कि AI writers, artists, coders, researchers, musicians, आदि के बाज़ार को कमज़ोर कर रहा है, क्योंकि यह उनके काम से बने सस्ते substitutes बेचता है।
- कुछ open-source और blog authors कहते हैं कि उन्हें सार्वजनिक रूप से publish करने का पछतावा है; अब उन्हें लगता है कि उनका unpaid work ऐसे tools को शक्ति दे रहा है जो उनके करियर समाप्त कर सकते हैं।
- दूसरे लोग कहते हैं कि aggregation और remixing ही है जिससे culture हमेशा आगे बढ़ा है; copyright maximalism को itself एक historical aberration बताया जाता है, जो बड़ी media firms से प्रेरित है।
- यह डर भी है कि original web content गायब हो जाएगा क्योंकि sites मर जाएँगी (costs, bot load, traffic loss), और knowledge प्रभावी रूप से proprietary models में “क़ैद” होकर AI-generated “slop” के नीचे दब जाएगी।
Commons बनाम property और redistribution
- एक पक्ष AI का स्वागत ultimate “information wants to be free” moment के रूप में करता है, और overextended IP के आंशिक उलटफेर के रूप में, विशेषकर उन works के लिए जो शायद public domain में होने चाहिए।
- दूसरा पक्ष ज़ोर देता है कि IP एक वैध अधिकार है; अगर copyrighted work पर training की अनुमति है, तो models और weights को भी commons का हिस्सा माना जाना चाहिए।
- सुझाए गए remedies में शामिल हैं: AI firms पर भारी taxes या profit-sharing, training data से जुड़े creator royalty schemes, या AI gains से funded universal benefits।
Regulation और structural proposals
- विचारों की सीमा इस प्रकार है:
- Training के लिए consent और licensing अनिवार्य करें, ऐसे opt-outs के साथ जो वास्तव में काम करें।
- Training data का disclosure और पुराने model weights की release अनिवार्य करें।
- Model outputs को uncopyrightable घोषित करें और संभावित रूप से original authors के claims के अधीन करें।
- Company size या compute पर cap लगाएँ, या कुछ proprietary frontier models पर ही ban लगा दें।
- कुछ लोग नोट करते हैं कि enforcement राजनीतिक रूप से कठिन होगा, खासकर geopolitical competition और corporate lobbying के कारण।
Open vs closed models और distillation
- Open-weight models को आंशिक democratization के रूप में उद्धृत किया जाता है, लेकिन आलोचक कहते हैं कि unlicensed data पर trained open weights भी “laundered theft” हैं।
- कई लोग distillation का बचाव एक “human right” के रूप में करते हैं—ऐसे models के साथ काम करने का अधिकार जिनकी training humanity के corpus पर हुई है; दूसरे चिंतित हैं कि यह बिना मुआवज़े के की गई मूल appropriation को और मज़बूत करता है।
व्यापक सामाजिक चिंताएँ
- Threads में ये विषय भी शामिल हैं:
- यदि AI मानसिक और शारीरिक, दोनों श्रम को automate कर दे तो wealth और power का concentration।
- विशाल data centers की environmental और infrastructure costs।
- Surveillance से तुलना: जब “public” data का उपयोग automated और centralized होकर extreme scale पर होता है, तब वह समस्या बन जाता है।