जज ने Claude को प्रशिक्षित करने के लिए उपयोग की गई पायरेटेड किताबों पर Anthropic के $1.5B समझौते को मंजूरी दी
एक अमेरिकी जज ने Anthropic को अपने Claude AI models को प्रशिक्षित करने के लिए पायरेटेड ebooks का उपयोग करने पर लगभग $3,000 प्रति शीर्षक के हिसाब से $1.5B का settlement देने की मंजूरी दी है, जबकि यह भी माना गया कि वैध रूप से हासिल की गई किताबों पर training fair use है। टिप्पणीकार इस बात पर बुरी तरह बँटे हुए हैं कि यह एक सार्थक remedy है या केवल “cost of doing business” है जो उच्च-गुणवत्ता वाले training data तक पहुँच की कीमत बढ़ाकर छोटे खिलाड़ियों को बाहर कर देता है और बड़े AI labs को मज़बूत करता है। चर्चा modern copyright enforcement की आलोचना, compensation पकड़ने में publishers बनाम authors की भूमिका, और यह कि क्या मौजूदा कानून human creators की रक्षा के लिए पर्याप्त है, तक फैल जाती है जब AI systems उनके काम से सीखते हैं और संभावित रूप से उसे regurgitate करते हैं।
फ़ैसले का दायरा
- थ्रेड बार-बार इस बात पर ज़ोर देता है: अदालत ने पायरेसी के लिए समझौते को मंजूरी दी, “किताबों पर प्रशिक्षण” को नहीं।
- वैध रूप से हासिल की गई किताबों पर LLMs का प्रशिक्षण fair use माना गया; उल्लंघन तब हुआ जब पायरेटेड ebooks की एक बड़ी, केंद्रीय लाइब्रेरी (जैसे LibGen से) रखी गई।
- अलग से, Anthropic ने लाखों भौतिक किताबें भी खरीदीं, उन्हें destructively scan किया, और मूल प्रतियाँ फेंक दीं; इसे fair use माना गया क्योंकि प्रतियाँ केवल आंतरिक थीं और प्रिंट कॉपीज़ का भुगतान किया गया था तथा उन्हें नष्ट कर दिया गया था।
समझौते का आकार और अर्थ
- $1.5B (~$3,000 प्रति किताब) को कुछ लोग बहुत हल्की सज़ा और लगभग “cost of doing business” मानते हैं, एक लगभग ट्रिलियन-डॉलर कंपनी के लिए।
- अन्य लोगों का तर्क है कि यह किताबें खरीदने की लागत से ~100× है और इसलिए एक उचित civil damages आंकड़ा है, खासकर क्योंकि इससे trial के जोखिम से बचा जा सकता है।
- आम तौर पर बताए गए विभाजन के अनुसार: पात्र शीर्षक पर लेखक और publisher के बीच लगभग 50/50; वकीलों को बड़ा लेकिन घटा हुआ हिस्सा; class reps को छोटे bonuses।
- कई लोगों का कहना है कि यह एक स्वैच्छिक civil settlement है, criminal case नहीं; यहाँ जेल कभी मुद्दा नहीं था।
Fair use, memorization, और derivative works
- एक पक्ष: training इंसानों के किताबों से सीखने जैसा है; LLMs आम तौर पर पूरे काम verbatim आउटपुट नहीं करते, इसलिए यह “transformative” fair use है।
- दूसरा पक्ष: कुछ मामलों में models लंबे copyrighted अंशों या लगभग verbatim किताबों को regurgitate कर सकते हैं, इसलिए इसे “transformative” कहना संदिग्ध है।
- इस पर बहस कि क्या models से होने वाली profitability से royalties या profit-sharing शुरू होनी चाहिए, और क्या outputs “derivative works” हैं।
लाभ और हानि का वितरण
- लेखक आम तौर पर कम भुगतान पाते हैं; कई किताबें अपना advance भी नहीं कमा पातीं। कुछ कहते हैं कि $3k/title बहुत से लेखकों को कभी मिलने वाली राशि से ज़्यादा है; अन्य इसे Anthropic के लाभ की तुलना में नाममात्र का पैसा मानते हैं।
- चिंता यह है कि अधिकांश पैसा publishers और वकीलों के पास जाता है, व्यक्तिगत writers तक नहीं।
- कई लोगों का तर्क है कि यह परिणाम बड़े labs को और मज़बूत करता है: केवल पूंजी-समृद्ध खिलाड़ी ही बड़े पैमाने पर किताबें खरीदने और legal risk उठाने का खर्च उठा सकते हैं, जिससे open और छोटे-scale models के लिए बाधाएँ बढ़ती हैं।
व्यापक copyright और नीति बहसें
- copyright के मूल्य पर तेज़ असहमति: कुछ लोग इसे छोटा या समाप्त करना चाहते हैं; अन्य इसे रचनात्मक काम के लिए फंडिंग का आवश्यक साधन मानते हैं।
- कुछ लोग training data के लिए ongoing royalties या यहाँ तक कि public-utility शैली की funding का प्रस्ताव रखते हैं; अन्य insist करते हैं कि अगर copyrighted works का उपयोग हो, तो open-weight releases होने चाहिए।
- perceived double standards पर ग़ुस्सा: कभी piracy के लिए individuals बर्बाद हो जाते थे, जबकि अब corporations manageable settlements देकर अपने models अपने पास रख रही हैं।