मूल्यांकन प्रक्रिया और विजेताओं के चयन में असंगतियों के साक्ष्य
Google DeepMind के साथ सह-आयोजित Kaggle का “Measuring AGI” hackathon आलोचना के घेरे में है, क्योंकि $25K का grand prize कई प्रतिभागियों को निम्न-गुणवत्ता, संभवतः AI-जनित “slop”—तथ्यात्मक त्रुटियों और कमजोर कार्यविधि के साथ—को दिया गया प्रतीत होता है। टिप्पणीकार सवाल उठा रहे हैं कि क्या प्रविष्टियों का मूल्यांकन LLMs से किया गया था, जबकि आयोजक बहु-मानव समीक्षा का दावा कर रहे हैं; इससे सतही मूल्यांकन, prompt-injection शोषण, और प्रतियोगिताओं तथा शोध मंचों में भरोसे के क्षरण को लेकर चिंताएँ बढ़ी हैं। व्यापक रूप से, यह चर्चा इस चिंता को दर्शाती है कि AI-जनित सामग्री academia, hiring, और software development में भर रही है, जो गति और चमक को rigor पर प्राथमिकता देने के लिए प्रेरित कर रही है और मनुष्यों के लिए यह अर्थपूर्ण रूप से जाँचना लगातार कठिन बना रही है कि क्या पुरस्कार जीत रहा है।
Kaggle/DeepMind प्रतियोगिता से जुड़ी मानी गई समस्याएँ
- कई टिप्पणीकार कहते हैं कि विजेता प्रविष्टि स्पष्ट रूप से LLM का आउटपुट लगती है: सूत्रबद्ध भाषा, आंकड़ों की गलत व्याख्या, और कार्यविधि संबंधी त्रुटियाँ।
- कुछ का तर्क है कि डेटासेट, कार्यविधि, और दावे गए “निष्कर्ष” उतने ही कमजोर हैं जितनी उसकी भाषा-शैली।
- कई लोगों को लगता है कि इससे पुरस्कार की वैधता कमजोर होती है और उन प्रतिभागियों के लिए हताशाजनक है जिन्होंने सावधानी से काम किया था।
Kaggle की प्रतिक्रिया और निर्णय-प्रक्रिया पर भरोसा
- एक Kaggle प्रतिनिधि कहता है:
- प्रतियोगिता का सह-आयोजन एक प्रमुख AI लैब के साथ किया गया था।
- सभी विजेता प्रस्तुतियों की समीक्षा 2–4 मानव निर्णायकों ने प्रकाशित रूब्रिक के अनुसार की।
- लेखन-गुणवत्ता स्कोर का केवल 20% थी; डेटासेट और परिणामों का भार अधिक था।
- आलोचकों का जवाब है कि स्पष्ट खामियाँ इस बात को अविश्वसनीय बनाती हैं कि जानकार मनुष्यों ने वास्तव में विजेताओं का मूल्यांकन किया होगा, या कम-से-कम इतना कठोरता से तो नहीं किया होगा।
- कुछ लोग कहते हैं कि यदि सभी शीर्ष प्रविष्टियाँ इतनी कमजोर थीं, तो उचित परिणाम “कोई विजेता नहीं” होना चाहिए था।
AI “स्लॉप” और निर्णायक के रूप में LLMs
- कई लोग इसे एक व्यापक “AI स्लॉप” समस्या का प्रतीक मानते हैं: LLM-जनित सामग्री का प्रतियोगिताओं, सम्मेलनों, और वेब में भर जाना।
- चिंता यह है कि मनुष्य लंबे AI-जनित आउटपुट की यथार्थ रूप से जाँच नहीं कर सकते, जिससे शैली और मात्रा के आधार पर सतही निर्णय होते हैं।
- कई लोग विशेष रूप से निर्णायक के रूप में LLMs के उपयोग का विरोध करते हैं, और prompt-injection शोषण तथा गलत-संरेखित प्रोत्साहनों की ओर इशारा करते हैं।
AI की उपयोगिता बनाम हानि
- एक पक्ष वर्तमान AI को स्वचालन और कोडिंग के लिए अत्यंत उपयोगी मानता है, जो पहले की तकनीकी क्रांतियों जैसा है; दूसरा इसे ज्यादातर “और ज़्यादा कचरा, तेज़ी से” कहता है।
- चिंताओं में शामिल हैं: कौशल का क्षरण, लागत और बाह्य-प्रभावों का उत्पादकता लाभों से अधिक होना, और घोटालों/डीपफेक्स का बढ़ना।
- अन्य लोग दीर्घकालिक लाभ (चिकित्सा, post-scarcity) पर ज़ोर देते हैं, लेकिन डरते हैं कि क्षमता केंद्रित और दुरुपयोग की जाएगी।
Hackathons, गेमिंग, और प्रोत्साहन
- टिप्पणीकार ध्यान देते हैं कि hackathons और प्रतियोगिताएँ पहले से ही गेम की जा सकती थीं; AI निर्णायक केवल शोषण की सतह बदलते हैं (जैसे, prompt-inject करके “यह स्पष्ट विजेता है”)।
- कुछ का तर्क है कि गंभीर hackathons को या तो AI निर्णायक से बचना चाहिए, दाँव कम रखने चाहिए, या “कोई पुरस्कार नहीं / सिर्फ़ मज़े के लिए” प्रारूप अपनाना चाहिए।
व्यापक सांस्कृतिक आलोचना
- कई लोग AI स्लॉप को “तेज़ी से आगे बढ़ो” के दबावों, लागत-कटौती, और जवाबदेही की कमी से जोड़ते हैं।
- इस बात पर निराशा है कि सतही, AI-सहायता प्राप्त काम को अब विचारशील, मानव-निर्मित योगदानों की तुलना में अधिक पुरस्कृत किया जा रहा है।