Google ने AI प्रशिक्षण डेटा के लिए Reddit के साथ एक समझौता किया
AI प्रशिक्षण के लिए Reddit डेटा को लाइसेंस करने का Google का $60M-प्रति-वर्ष का सौदा इस बहस को जन्म दे रहा है कि जब उपयोगकर्ता-निर्मित सामग्री का मुद्रीकरण होता है, तो किसे लाभ मिलना चाहिए। टिप्पणीकार सवाल उठाते हैं कि क्या Reddit का पोस्टों का भंडार वास्तव में उच्च-गुणवत्ता वाला है या भारी astroturfing से प्रभावित, और क्या यह कदम अधिक बातचीत को निजी या paywalled जगहों में धकेलकर “open internet” को और कमज़ोर करेगा। अन्य लोग नोट करते हैं कि Reddit की terms of service पहले से ही सामग्री के व्यापक पुन: उपयोग की अनुमति देती हैं, इस सौदे को विज्ञापन बिक्री जैसी IPO-प्रेरित मुद्रीकरण के रूप में देखते हैं, और चिंता करते हैं कि योगदानकर्ताओं को वित्तीय लाभ का कोई हिस्सा नहीं मिलेगा।
समझौते का आकार, मूल्य, और विशिष्टता
- बहुत से लोग $60M/वर्ष को सस्ता मानते हैं, क्योंकि Reddit खोज में कितना केंद्रीय है और उसके नियोजित $5B IPO वैल्यूएशन को देखते हुए; कुछ का अनुमान है कि Reddit संबंधी क्वेरियाँ उनके अपने Google उपयोग का बड़ा हिस्सा हैं।
- अन्य लोग तर्क देते हैं कि आप वार्षिक लाइसेंस फ़ीस की तुलना कंपनी के कुल मूल्य से नहीं कर सकते; Reddit डेटा कई AI विक्रेताओं को दोबारा बेच सकता है।
- कई लोगों का सुझाव है कि यह भुगतान इंक्रीमेंटल API एक्सेस और कानूनी सुरक्षा के लिए है, क्योंकि Google पहले से ही Reddit को इंडेक्स करता है; विशिष्टता पर व्यापक रूप से संदेह है।
- अल्पमत विचार: उपयोगकर्ताओं द्वारा मुफ़्त में बनाए गए डेटा के लिए भुगतान करना “अशोभनीय” है, खासकर बिना यूज़र राजस्व-साझाकरण के, जबकि अन्य जवाब देते हैं कि होस्टिंग और कम्युनिटी-निर्माण Reddit के हिस्से को उचित ठहराते हैं।
डेटा स्वामित्व, मुआवज़ा, और ToS
- कई टिप्पणियाँ Reddit के ToS को उजागर करती हैं, जो उसे व्यापक, स्थायी, सब-लाइसेंस योग्य अधिकार देते हैं; उपयोगकर्ता प्रभावी रूप से डेटा पुनर्विक्रय के लिए सहमति देते हैं।
- कुछ लोग तर्क देते हैं कि अगर लोगों को भुगतान चाहिए होता, तो वे सार्वजनिक रूप से मुफ़्त में पोस्ट नहीं करते; अन्य कहते हैं कि उन्होंने चर्चा और विज्ञापन-समर्थित होस्टिंग के लिए पोस्ट किया था, न कि प्रशिक्षण डेटा के रूप में।
- चिंता है कि इससे इंटरनेट “विचारों के बाज़ार” से AI और शेयरधारकों के कच्चे माल में बदल रहा है, और सद्भावना कम हो रही है।
- StackOverflow और विज्ञापन से तुलना: इस पर बहस कि क्या डेटा-के-बदले-विज्ञापन का समझौता डेटा-के-बदले-AI से “अधिक निष्पक्ष” निहित सौदा था।
खुले वेब, गोपनीयता, और प्लेटफ़ॉर्म्स पर प्रभाव
- कई लोगों का मानना है कि किसी भी सार्वजनिक सामग्री की AI स्क्रैपिंग अब अपरिहार्य है; उम्मीद है कि अधिक चर्चा निजी या अर्ध-निजी स्थानों (Discord, आदि) में चली जाएगी, हालांकि वे भी डेटा का मुद्रीकरण कर सकते हैं।
- अन्य लोग डेटा और कंप्यूट दोनों के कुछ ही फर्मों में केंद्रीकरण को खतरनाक और कम-नियंत्रित मानते हैं।
- कुछ इस कदम को IPO की तैयारी और दीर्घकालिक API मुद्रीकरण के रूप में देखते हैं, जिसमें सार्वजनिक APIs और खोज पहुँच को बंद करना भी शामिल है।
Reddit डेटा की गुणवत्ता और पक्षपात
- Reddit को अच्छे प्रशिक्षण डेटा के रूप में लेकर काफ़ी संदेह है: भारी astroturfing, वोटों को गेम करने वाले bots, echo chambers, और “आत्मविश्वास से गलत” hive-mind उत्तर।
- राजनीतिक और वैचारिक झुकाव, साथ ही कुछ subreddits में आक्रामक moderation एजेंडाओं को लेकर चिंताएँ हैं, जो AI को पक्षपाती बना सकती हैं।
- मज़ाक कि इससे AI और अधिक व्यंग्यात्मक, नैतिकतावादी, और गलत हो जाएगा, लेकिन यह भी मान्यता कि कई LLMs पहले ही पुराने Reddit dumps का उपयोग कर चुके हैं।
उपयोगकर्ता प्रतिक्रियाएँ और प्रतिरोधी उपाय
- कुछ लोग कहते हैं कि वे Reddit में योगदान कम करेंगे या बंद कर देंगे, यानी “समय से वोटिंग” करेंगे।
- पुराने Reddit content को बड़े पैमाने पर हटाने या scramble करने के टूल्स एक रक्षात्मक कदम के रूप में साझा किए जा रहे हैं, हालांकि यह लेकर संदेह बना हुआ है कि Reddit क्या retain करता है और क्या resell करता है।