NY Times कॉपीराइट मुकदमा OpenAI से सभी GPT इंस्टेंस मिटाने की मांग करता है
न्यूयॉर्क टाइम्स का OpenAI और Microsoft के खिलाफ मुकदमा आरोप लगाता है कि उनकी AI models को लाखों copyrighted Times articles बिना अनुमति के train किया गया, वे कभी-कभी उन्हें verbatim पुन: प्रस्तुत कर सकती हैं, और अब अख़बार के subscription-based business से प्रतिस्पर्धा करती हैं। टिप्पणीकार बहस करते हैं कि यह training संरक्षित “fair use” है या बड़े पैमाने की piracy के अधिक निकट, search engines, human learning, और पिछली copyright cases के साथ उपमाएँ देते हुए, तथा paywalls और terms of service की भूमिका पर तर्क करते हुए। कई लोगों को उम्मीद है कि यह मामला—या ऐसा ही कोई अन्य—इस बात के लिए महत्वपूर्ण कानूनी precedents स्थापित करेगा कि generative AI कॉपीराइटेड सामग्री का उपयोग कैसे कर सकती है, और इसके दांव बड़े tech तथा छोटे या open-source AI प्रयासों दोनों के लिए बहुत ऊँचे हैं।
NYT मुकदमे का दायरा और लक्ष्य
- NYT की मांग: उसके कंटेंट पर प्रशिक्षित GPT मॉडलों का विनाश, प्रशिक्षण डेटासेट्स का हटाया जाना, और एक स्थायी निषेधाज्ञा के साथ बड़े मौद्रिक हर्जाने।
- कई लोग इसे एक अधिकतमवादी शुरुआती चाल मानते हैं, जिसका उद्देश्य वास्तव में GPT को “मारना” नहीं बल्कि लाइसेंसिंग डील के लिए दबाव बनाना है।
- कुछ लोगों का मानना है कि समय-निर्धारण व्यापक AI–प्रकाशक वार्ताओं (जैसे Apple और अन्य के साथ) से जुड़ा है।
कॉपीराइट, fair use, और scraping
- केंद्रीय प्रश्न: क्या कॉपीराइटेड लेखों का प्रशिक्षण के लिए उपयोग स्वयं उल्लंघन है, या केवल तब उल्लंघन है जब आउटपुट मूल से बहुत करीब हों?
- fair use के कारकों पर बहस:
- उद्देश्य/चरित्र: रूपांतरकारी सीखना बनाम वाणिज्यिक प्रतिस्थापन।
- प्रकृति: समाचार आंशिक रूप से तथ्यात्मक है लेकिन उसमें रचनात्मक अभिव्यक्ति भी है।
- मात्रा: मॉडल पूरे अभिलेखागार ingest करते हैं।
- बाज़ार प्रभाव: क्या LLMs वास्तव में NYT के पाठकों या लाइसेंसिंग बाज़ारों की जगह ले रहे हैं।
- scraping की वैधता और ToS: कुछ लोग सार्वजनिक वेब scraping को वैध बताने वाले precedents का हवाला देते हैं; अन्य paywalls, बदली हुई NYT शर्तों, और robots.txt को गैर-सहमति के प्रमाण के रूप में देखते हैं।
Memorization, regurgitation, और तकनीकी fixes
- NYT के सबसे मज़बूत उदाहरण paywalled लेखों और पहले पैराग्राफ़ों का लगभग शब्दशः पुनरुत्पादन हैं।
- एक पक्ष: यह साबित करता है कि मॉडल में कॉपीराइटेड कृतियाँ “मौजूद” हैं और training, मानव-शैली की सीख की तुलना में, compressed copying जैसी है।
- दूसरा पक्ष: ये दुर्लभ overfitting edge cases हैं जिन्हें lower temperatures, filters (n‑grams/bloom), RLHF, या स्रोतों के pre-summarization से कम किया जा सकता है।
- अतिरिक्त चिंता: मॉडल झूठी NYT सामग्री hallucinate करते हैं, जिससे defamation और trademark-dilution के कोण उभरते हैं।
मानव बनाम मशीन उपमाएँ
- OpenAI के समर्थक training की तुलना एक व्यक्ति द्वारा NYT पढ़ने और बाद में उसे summarize करने या उससे “प्रभावित” होने से करते हैं, और तर्क देते हैं कि architecture का कानूनी महत्व नहीं होना चाहिए।
- आलोचक scale, reproducibility, और commercial deployment पर जोर देते हैं: लाखों उपयोगकर्ता, automated paywall bypass, और एक ही कंपनी द्वारा दूसरों के काम का मुद्रीकरण।
- “अगर इंसान कर सकता है, तो मॉडल भी कर सकता है” तर्क के खिलाफ बार-बार प्रतिवाद किया गया है, यह बताते हुए कि tools और लोगों के लिए कानून अलग तरह से व्यवहार करता है।
आर्थिक, प्रतिस्पर्धी, और सामाजिक प्रभाव
- कई लोग अंततः एक licensing regime की उम्मीद करते हैं: बड़े प्रकाशकों को सीधे भुगतान, छोटे निर्माताओं को संभवतः pools के माध्यम से; LLM access अधिक महंगा हो जाता है।
- चिंता है कि मजबूत copyright rulings deep-pocketed कंपनियों (OpenAI, MS, Apple, Google) को लाभ देंगे, open-source और startups को नुकसान पहुँचाएँगे, और संभवतः frontier काम को कमजोर IP enforcement वाले jurisdictions की ओर धकेल देंगे।
- अन्य लोग तर्क देते हैं कि journalism और creative labor के लिए incentives बनाए रखने, और कुछ AI कंपनियों द्वारा वेब के मूल्य का privatization रोकने के लिए यह बाधा ज़रूरी है।
- थ्रेड वर्तमान copyright की लंबाई और दायरे को लेकर व्यापक असहजता दिखाता है, लेकिन इस बात पर तीखी असहमति है कि क्या AI training को स्पष्ट रूप से legal fair use के रूप में अलग रखा जाना चाहिए।