arXiv पर AI लेखन को हमने कैसे मापा, और माप कहाँ टूट जाता है
2021–2026 के 12,750 arXiv papers के एक विश्लेषण में दावा किया गया है कि हालिया submissions में 39% तक, और computer science में 65% तक, AI-generated लेखन के सांख्यिकीय संकेत दिखते हैं, जबकि ChatGPT के रिलीज़ से पहले यह 0.4% था। टिप्पणीकार AI detectors की विश्वसनीयता और पारदर्शिता पर सवाल उठाते हैं, false positives के उदाहरण साझा करते हैं, और नोट करते हैं कि बदलती लेखन शैलियाँ तथा AI “polishing” का व्यापक उपयोग human और machine text के बीच की रेखा को धुंधला कर देता है। यह चर्चा इस बात से जूझती है कि क्या AI-assisted papers वास्तव में समस्या हैं भी या नहीं, और trust, fraud, reviewer overload, तथा विज्ञान में writing को quality signal के रूप में देखने के क्षरण पर चिंताएँ उठाती है।
डिटेक्टर की कार्यप्रणाली और विश्वसनीयता
- कई टिप्पणीकार डिटेक्टर की कठोरता, व्याख्येयता, और पुनरुत्पादकता पर सवाल उठाते हैं, खासकर जिस तरह कई उप-स्कोरों को जोड़ा जाता है।
- उपयोगकर्ता स्पष्ट रूप से मानव-निर्मित, pre-LLM काम (थीसिस, पुराने पेपर, Stack Overflow उत्तर) पर भी ऊँचे “machine” स्कोर रिपोर्ट करते हैं, जिससे गैर-तुच्छ false positives का संकेत मिलता है।
- अन्य लोग अपने ही टेक्स्ट पर डिटेक्टर को अच्छा प्रदर्शन करते देखते हैं और calibrated pre-ChatGPT false-positive rate (~0.4%) को इस बात का प्रमाण मानते हैं कि यह “औसतन काम करता है।”
- चिंताओं में शामिल हैं:
- प्रशिक्षण डेटा leakage और domain drift (नई jargon, बदलती शैलियाँ)।
- LaTeX/फॉर्मैटिंग के प्रति संवेदनशीलता।
- केवल text-based detection की सैद्धांतिक सीमाएँ और human तथा AI शैलियों का अभिसरण।
- Pangram और GPTZero जैसे commercial tools को “काफी accurate” और “आसानी से fool किए जा सकने वाले” दोनों कहा गया है, जो व्यवहार में “accuracy” के अर्थ पर असहमति को रेखांकित करता है।
प्रचलन के अनुमान और वे कहाँ विफल हो सकते हैं
- कुल मिलाकर ~39% AI-flagged papers और CS में ~65% तक की reported बढ़ोतरी कुछ लोगों को चौंकाने वाली लगती है, और arXiv के उपसमूहों पर स्वतंत्र जाँचों के लगभग अनुरूप भी है।
- अन्य लोग तर्क देते हैं कि baseline कमजोर है: भाषा और रुझान बदलते रहते हैं, और डिटेक्टर “modern style” या topic drift (जैसे LLM jargon) को पकड़ रहे हो सकते हैं, न कि वास्तविक AI authorship को।
- सुझाव: पुराने preprints (pre-2020) शामिल करें, क्षेत्र के अनुसार breakdown करें, और नियंत्रण के रूप में संभवतः अधिक curational venues (जैसे top journals) पर detectors लागू करें।
“तो क्या?” विज्ञान और भरोसे पर असर
- एक पक्ष कोई अंतर्निहित समस्या नहीं देखता: यदि विज्ञान सही है और पेपर अधिक स्पष्ट हो जाते हैं, तो AI सहायता स्वीकार्य है; असली मुद्दा शोध की गुणवत्ता है, न कि वाक्य किसने लिखे।
- विरोधी दृष्टिकोण जोर देता है:
- LLMs की तथ्यों, citations, और यहाँ तक कि पूरे related-work narratives गढ़ लेने की प्रवृत्ति।
- भरोसे और गुणवत्ता-संकेतों का क्षरण (चमकदार prose अब effort या rigor का संकेत नहीं देता)।
- reviewer burden में वृद्धि और signal-to-noise का बिगड़ना, spam और “enshittification” जैसी उपमाओं के साथ।
- उन पेपरों के उदाहरण दिए जाते हैं जिनमें पूरी तरह hallucinated citations थीं, और conference reviewing के पहले से ही strained और low-effort होने की बात भी की जाती है।
पॉलिशिंग और non-native authors के लिए LLMs का उपयोग
- non-native speakers बताते हैं कि वे LLMs का उपयोग “basic” English को conventional scientific prose में बदलने के लिए करते हैं; कई लोग इसे आवश्यक और उचित मानते हैं, बशर्ते वैज्ञानिक सामग्री की जाँच हो।
- आलोचकों का तर्क है कि:
- “Polishing” अक्सर नए दावे जोड़ देता है या अर्थ को सूक्ष्म रूप से बदल देता है।
- एक सामान्य “scientific style” का पीछा करना स्वयं हानिकारक और अनावश्यक है।
- इस पर असहमति है कि यह एक मामूली tool use है या substantive co-authorship, जो व्यक्तिगत जवाबदेही को कमजोर करता है।
प्रोत्साहन, spam, और detection arms race
- टिप्पणीकार AI उपयोग में वृद्धि को संरचनात्मक प्रोत्साहनों से जोड़ते हैं: publish-or-perish, writing से नफ़रत, और सस्ते text generation।
- कुछ लोग और अधिक “spam papers” की उम्मीद करते हैं और AI-style text को एक coarse filter की तरह मानने की वकालत करते हैं, भले ही यह कभी-कभी अच्छे काम को भी अस्वीकार कर दे।
- अन्य लोग detectors के दुरुपयोग के खतरे (खासकर शिक्षा में) को रेखांकित करते हैं और नोट करते हैं कि AI-generated और AI-evading text दोनों आसानी से बनाए जा सकते हैं, जिससे detection में किसी स्थिर equilibrium की संभावना कम है।