NY टाइम्स यह मांग कर रहा है कि Times डेटा पर प्रशिक्षित सभी LLMs नष्ट कर दिए जाएँ
OpenAI और Microsoft के खिलाफ न्यूयॉर्क टाइम्स के मुकदमे, जिसमें Times लेखों पर प्रशिक्षित AI मॉडलों को हटाने की मांग की गई है, ने इस व्यापक टकराव को तेज कर दिया है कि कॉपीराइट large language models पर कैसे लागू होता है। टिप्पणीकर्ता इस पर बहस कर रहे हैं कि क्या कॉपीराइटेड पाठ पर प्रशिक्षण को मानव सीखने और fair use की तरह माना जाए, या इसे बड़े पैमाने पर, बिना मुआवज़े के शोषण के रूप में देखा जाए जो ऐसे रचनाकारों को नुकसान पहुँचाता है जिनका काम शब्दशः दोहराया जा सकता है। कई लोगों को उम्मीद है कि अदालतें केवल प्रशिक्षण पर नहीं, बल्कि model outputs और market impact पर ध्यान देंगी; संभावित परिणाम licensing और royalties से लेकर सख़्त सीमाओं तक हो सकते हैं, जो बड़े tech firms को मज़बूत करें और भविष्य की AI systems के निर्माण को बदल दें।
मुकदमे का दायरा और “मॉडलों को नष्ट करो” की मांग
- चर्चा का केंद्र NYT का OpenAI/Microsoft के खिलाफ मुकदमा है और यह मांग है कि Times सामग्री पर प्रशिक्षित मॉडलों को हटाया जाए।
- कई टिप्पणियों में कहा गया कि अदालतें केवल नामित प्रतिवादियों के खिलाफ राहत दे सकती हैं, “सभी LLMs” के खिलाफ नहीं, इसलिए व्यापक विनाश की प्रार्थना मुख्यतः बयानबाज़ी का दबाव है।
- अन्य लोग इस मुकदमे को ज़रूरी प्रतिरोध मानते हैं, क्योंकि अलग-अलग रचनाकार ऐसी मुकदमेबाज़ी वहन नहीं कर सकते।
कॉपीराइटेड सामग्री पर प्रशिक्षण की कानूनी स्थिति
- व्यापक रूप से माना गया कि वैधता अभी तय नहीं है; कई चल रहे मुकदमों से यह स्पष्ट होने की उम्मीद है कि क्या प्रशिक्षण fair use है।
- एक पक्ष: प्रशिक्षण = पढ़ना/सीखना; कॉपीराइट पुनरुत्पादन को सीमित करता है, विचारों को सीखने या याद रखने को नहीं। छात्रों, सर्च इंजन, और ISP/browser caching से तुलना की गई।
- दूसरा पक्ष: LLMs व्यावसायिक उपकरण हैं, मनुष्य नहीं; उन्हें लोगों की तरह मानना भ्रामक है। अनुमति के बिना कॉपीराइटेड पाठ का बड़े पैमाने पर, लाभ के लिए उपयोग उल्लंघन या चोरी जैसा माना जाता है।
- इस पर बहस कि क्या मॉडल वेट्स स्वयं कृतियों की “प्रतियां” हो सकते हैं, यदि मॉडल लगभग शब्दशः पाठ निकाल सकता है।
आउटपुट, रेज़र्गिटेशन, और संभावित उपाय
- इस बात पर व्यापक सहमति है कि paywalled या कॉपीराइटेड पाठ का शब्दशः या लगभग शब्दशः पुनरुत्पादन कानूनी रूप से जोखिम भरा है।
- प्रस्तावित तकनीकी समाधान: आउटपुट की NYT पाठ से तुलना करने वाले post-filters; NYT डेटा के बिना retraining; या ऐसे मॉडल बनाना जो लंबे अंश पुन: उत्पन्न न कर सकें।
- कुछ लोगों का तर्क है कि उल्लंघन विशिष्ट आउटपुट और उनके उपयोगकर्ताओं पर लागू होना चाहिए, न कि केवल मॉडल के अस्तित्व पर।
नैतिक और आर्थिक दृष्टिकोण
- गहरी विभाजित राय:
- कुछ लोग LLMs को औद्योगिक पैमाने की साहित्यिक चोरी मानते हैं, जो पत्रकारों, कलाकारों, और प्रोग्रामरों को नुकसान पहुँचाती है और धन के और अधिक संकेंद्रण को बढ़ावा देती है।
- अन्य लोग इन्हें एक और तकनीकी परत मानते हैं (VCRs, औद्योगिकीकरण, या word processors की तरह) जो पूर्व संस्कृति पर आधारित है और अंततः उत्पादकता बढ़ाती है।
व्यावहारिक और रणनीतिक निहितार्थ
- NYT सामग्री के बिना retraining को अत्यंत महँगा बताया गया है, लगभग शुरुआत से फिर से बनाने जितना।
- licensing को कई लोग संभावित अंतिम परिणाम मानते हैं, लेकिन चिंता है कि इससे अनेक समान दावे करने का precedent बनेगा और proprietary डेटा वाले बड़े incumbents को फायदा होगा।
- कुछ लोग public-domain models या अनिवार्य licensing/royalty schemes का सुझाव देते हैं; अन्य, अधिक कट्टर रूप से, मॉडलों या यहाँ तक कि सभी प्रकाशित कृतियों को training के लिए उपलब्ध कराने की बात करते हैं।