द न्यूयॉर्क टाइम्स ने Microsoft और OpenAI के खिलाफ एक मजबूत मामला पेश किया
अपने लेखों का उपयोग करके AI systems को train और power करने को लेकर New York Times का Microsoft और OpenAI के खिलाफ मुकदमा copyright, fair use, और AI-generated content से जुड़े अनसुलझे सवालों का केंद्र बन गया है। Commenters कानूनी सिद्धांतों की पड़ताल करते हैं—शब्दशः पुनरुत्पादन और DMCA दावों से लेकर इस तक कि क्या AI सेवाएँ समाचार संस्थानों के साथ अवैध रूप से प्रतिस्पर्धा करती हैं या उनका विकल्प बनती हैं—और बहस करते हैं कि क्या कॉपीराइटेड डेटा पर training के लिए लाइसेंस आवश्यक होने चाहिए या इसे fair use के रूप में संरक्षित किया जाना चाहिए। माना जा रहा है कि इसका परिणाम AI developers और content producers, दोनों के business models को पुनर्परिभाषित कर सकता है, साथ ही open-source models, वैश्विक प्रतिस्पर्धा, और भविष्य के copyright regimes पर भी असर डाल सकता है.
NYT के दावों का दायरा
- NYT सिर्फ प्रशिक्षण को ही चुनौती नहीं दे रहा; शिकायत का निशाना यह भी है:
- ऐसे मॉडल जो NYT के लेख या बड़े अंश शब्दशः आउटपुट कर सकते हैं।
- “Synthetic search” / ब्राउज़िंग फीचर (Bing Chat, ChatGPT Browse), जो वास्तविक समय में NYT सामग्री लाते हैं और उसे पराफ्रेज़ या उद्धृत करते हैं।
- बिना लाइसेंस के NYT सामग्री का उपयोग, जिसमें कथित रूप से copyright management info हटाना (DMCA §1202) शामिल है।
- NYT, OpenAI/Microsoft को ऐसे उत्पाद बनाने के रूप में प्रस्तुत करता है जो सीधे NYT (Wirecutter सहित) का विकल्प बनते हैं, जिससे उसका व्यवसाय मॉडल प्रभावित होता है।
Fair Use, Training, और शब्दशः पुनरुत्पादन
- एक पक्ष: कॉपीराइटेड टेक्स्ट पर प्रशिक्षण fair use हो सकता है; व्यापक रूप से प्रशिक्षित मॉडलों से कभी-कभार होने वाली regurgitation अपने-आप में infringement नहीं होनी चाहिए।
- दूसरा पक्ष: मामले के कुछ हिस्से NYT के लिए “आसान” हैं क्योंकि आरोप है कि सिस्टम लेखों को लगभग शब्दशः पुनरुत्पादित करते हैं या paywall workaround की तरह काम करते हैं।
- इस पर बहस कि क्या मुख्य प्रश्न training-as-fair-use है या downstream use और market substitution है (जहाँ Warhol precedent का हवाला देकर “use not transformative” कहा गया है)।
RAG, Paywalls, और प्रतिस्पर्धा
- “Grounding” / retrieval-augmented generation कथित रूप से:
- NYT पेजों को कॉपी करता है (paywalled पेजों सहित), उन्हें मॉडल को फीड करता है, फिर पराफ्रेज़ या लंबे उद्धरण आउटपुट करता है।
- attribution और affiliate links (जैसे Wirecutter) हटा देता है, जिससे NYT एक बिना मुआवज़े वाला backend बन जाता है।
- कुछ लोग तर्क देते हैं कि यह Google snippets जैसा है और fair use हो सकता है; अन्य ध्यान दिलाते हैं कि Google लिंक वापस देता है और कुछ क्षेत्रों में पहले से licensing के लिए भुगतान भी करता है।
Liability, Libel, और Hallucinations
- थ्रेड में इस पर विवाद है कि hallucinated NYT “quotes” libel या trademark claims को समर्थन दे सकते हैं या नहीं:
- कुछ कहते हैं कि जिन कंपनियों को पता है कि मॉडल नियमित रूप से fabricate करते हैं, उन पर “actual malice” या reckless disregard लागू हो सकता है।
- अन्य इसे कमजोर मानते हैं: नुकसान सिद्ध करना कठिन है और LLMs के आउटपुट को स्पष्ट रूप से त्रुटिपूर्ण होने की चेतावनी के साथ पेश किया जाता है।
- आउटपुट को “lies” बनाम “hallucinations” बनाम “fabrications” कहने पर तीव्र असहमति।
मानव बनाम सॉफ़्टवेयर सीखना और personhood
- एक बड़ा उप-थ्रेड इस पर है कि “मनुष्य कॉपीराइटेड कृतियों से सीखते हैं, इसलिए AI भी सीख सकता है” क्या एक वैध तुलना है:
- एक पक्ष: सॉफ़्टवेयर सिर्फ एक tool है; liability केवल मनुष्यों/कॉर्पोरेशनों पर हो सकती है, और scale + exact copying महत्वपूर्ण हैं।
- दूसरा पक्ष: यदि वह काम जिसे मनुष्य कानूनी रूप से कर सकते हैं, अन्य tools में automate करना स्वीकार्य है (जैसे Photoshop), तो यह स्पष्ट नहीं कि LLMs के साथ अलग व्यवहार क्यों होना चाहिए।
- corporate personhood, संभावित भविष्य की AI personhood, और क्या मनुष्य कानून और नैतिकता में “विशेष” हैं, इस पर अतिरिक्त बहस।
आर्थिक, प्रतिस्पर्धी, और नीति संबंधी प्रभाव
- कुछ लोगों को अपेक्षा है कि एक settlement और licensing regime (संभवतः collective या compulsory licensing) बनेगा, न कि “kill AI” precedent।
- अन्य चेतावनी देते हैं:
- भारी licensing बड़े tech और बड़े media को मज़बूत कर सकती है, जिससे open-source और छोटे खिलाड़ियों के लिए रास्ता बंद हो सकता है।
- कड़े US rulings उन jurisdictions को लाभ दे सकते हैं जहाँ training rules ढीले हैं (जैसे Japan/EU debates के संदर्भ)।
- कई commenters का मानना है कि NYT का endgame AI का विरोध नहीं, बल्कि बेहतर licensing deal के लिए leverage है।
तकनीकी और Open-Source नोट्स
- Commenters चर्चा करते हैं:
- Temperature=0 और crafted prompts से शब्दशः regurgitation संभव है; यह सामान्य उपयोग में कितना आम है, स्पष्ट नहीं।
- infringement कम करने के लिए post-processing (plagiarism checks, forced citation, RAG with explicit links) की संभावना।
- कुछ लोग अनुमान लगाते हैं कि मुकदमे मुख्यतः proprietary US models को नुकसान पहुँचाएँगे, जबकि US legal reach के बाहर प्रशिक्षित open-source और विदेशी models आगे बढ़ते रहेंगे।