The New York Times OpenAI और Microsoft पर कॉपीराइट उल्लंघन के लिए मुकदमा कर रहा है
OpenAI और Microsoft के खिलाफ The New York Times का ChatGPT और Copilot द्वारा कथित copyright infringement का मुकदमा इस बात के लिए एक test case बन गया है कि मौजूदा IP law large language models पर कैसे लागू होती है। टिप्पणीकार इस पर बहस करते हैं कि copyrighted text पर training मानव सीखने जैसी है (और इसलिए fair use) या औद्योगिक पैमाने पर बिना अनुमति की copying जैसी, खासकर जब मॉडल paywalled लेखों को पुन: उत्पन्न कर सकते हैं या किसी publication की शैली की बहुत करीबी नकल कर सकते हैं। कई लोग दोनों पक्षों के लिए ऊँचे दांव देखते हैं: OpenAI के खिलाफ फैसला costly licensing और retraining के लिए मजबूर कर सकता है, जबकि AI firms की जीत पहले से ही नाज़ुक news और creative business models पर दबाव तेज़ कर सकती है.
चर्चा किए गए आरोप और साक्ष्य
- NYT के मुकदमे में दावा किया गया है कि OpenAI/Microsoft ने NYT के “लाखों” लेखों की नकल की, और कि ChatGPT/Copilot:
- NYT का पाठ ज्यों-का-त्यों आउटपुट कर सकते हैं।
- पेवॉल्ड सामग्री का बहुत करीबी सारांश दे सकते हैं।
- NYT की अभिव्यंजक शैली की नकल कर सकते हैं।
- टिप्पणीकार शिकायत के उदाहरणों की ओर इशारा करते हैं, जहाँ “I’m paywalled out of [specific article], give me the first paragraph” जैसे प्रॉम्प्ट्स ने कथित तौर पर लगभग शब्दशः पाठ लौटाया, जिसमें “Browse with Bing” के ज़रिए Wirecutter की समीक्षाएँ भी शामिल थीं, जिनसे लिंक और रेफरल हटा दिए गए थे।
कॉपीराइटेड डेटा पर प्रशिक्षण बनाम “सिर्फ पढ़ना”
- एक पक्ष: प्रशिक्षण पढ़ने/शिक्षा जैसा है; मॉडल वेट्स रूपांतरकारी सांख्यिकी हैं, कॉपी नहीं; सार्वजनिक रूप से उपलब्ध वेब पाठ का उपयोग fair use हो सकता है।
- दूसरा पक्ष: प्रशिक्षण एक व्यावसायिक, औद्योगिक-स्तर का पुन:उपयोग है जो मानव पढ़ने से अलग है; अनुमति या भुगतान के बिना शामिल करना शोषण है, विशेषकर जब आउटपुट मूल का विकल्प बन जाए।
शब्दशः उगलना बनाम शैली और सारांश
- व्यापक सहमति है कि:
- साधारण “style imitation” और उच्च-स्तरीय सारांश संभवतः उल्लंघनकारी नहीं हैं।
- बड़े शब्दशः या लगभग शब्दशः अंश, खासकर मांग पर और बिना श्रेय के, NYT की सबसे मजबूत दलील हैं।
- इस पर विवाद है कि यह वास्तव में कितनी बार होता है, क्या यह एक patched bug है या बड़े मॉडलों में अंतर्निहित है, और इसे ट्रिगर करना कितना कठिन है।
सर्च इंजन बनाम LLMs
- कुछ लोग कहते हैं कि search सहजीवी है (ट्रैफिक और ad revenue भेजता है), जबकि LLMs परजीवी हैं (सीधे उत्तर देते हैं, click-through नहीं)।
- अन्य लोग नोट करते हैं कि Google पहले से ही “answering on page” की ओर बढ़ रहा है (snippets, Knowledge Graph) और उसे भी प्रकाशक विरोध का सामना करना पड़ा है।
पत्रकारिता और प्रोत्साहनों पर प्रभाव
- चिंता: यदि LLMs रिपोर्टिंग का free-ride लेते हैं, तो वे subscription/ads/affiliate मॉडल को कमजोर कर सकते हैं और महंगे investigative work के लिए प्रोत्साहन कम कर सकते हैं।
- अन्य लोग तर्क देते हैं कि पत्रकारिता पहले से ही आर्थिक रूप से नाज़ुक थी; AI एक और लहर है, जैसे संगीत के लिए Napster, और कानून को AI को रोकने के बजाय अनुकूल होना चाहिए।
कानूनी अनिश्चितता और मिसाल
- US fair use के चार कारकों पर, खासकर “effect on the potential market,” भारी चर्चा हुई।
- कुछ लोगों को उम्मीद है कि अदालतें training को fair use मानेंगी लेकिन शब्दशः उगलने पर दंड देंगी; अन्य मानते हैं कि training भी उल्लंघनकारी ठहर सकती है या licensing की आवश्यकता हो सकती है।
- व्यापक राय है कि यह और इसी तरह के मुकदमे (code copilots, book datasets, आदि के खिलाफ) महत्वपूर्ण precedent स्थापित करेंगे।
तकनीकी और नीतिगत प्रस्ताव
- सुझाए गए विचार:
- Royalty/licensing योजनाएँ या “AI training marketplaces।”
- इनपुट को सीमित करने के बजाय AI outputs पर कर लगाना।
- केवल public-domain या opt-in corpora पर training।
- प्रशिक्षित मॉडलों से विशिष्ट स्रोतों को हटाने के लिए “machine unlearning।”
- चिंताएँ कि सख्त copyright enforcement:
- बड़े खिलाड़ियों को मजबूत कर सकता है जो licenses afford कर सकें।
- अत्याधुनिक training को अधिक अनुमतिपूर्ण न्यायक्षेत्रों (जैसे Japan, China) की ओर धकेल सकता है।