शीर्ष AIs अभी भी IQ परीक्षणों में असफल होती हैं

यह दावा कि शीर्ष AI मॉडल अभी भी मानक IQ परीक्षणों में “असफल” होते हैं, इस बहस को जन्म देता है कि क्या ऐसे परीक्षण मशीन बुद्धिमत्ता को वास्तव में मापते भी हैं। टिप्पणीकारों का तर्क है कि बड़े भाषा मॉडल शक्तिशाली next-token predictors हैं, जिनकी सामान्यता प्रभावशाली लेकिन सतही है, और जो दृष्टि व तर्क सीमाओं, memorization-heavy “reasoning,” तथा सचमुच नए समस्याओं में कठिनाई से बाधित हैं। कई लोग निष्कर्ष निकालते हैं कि IQ स्कोर और AGI जैसे लेबल वास्तविक दुनिया की उपयोगिता और क्षमता-वृद्धि की तेज़ गति की तुलना में कम महत्वपूर्ण हैं, जो मौजूदा बेंचमार्क को अप्रासंगिक बना सकती है।

AI के लिए IQ परीक्षणों की प्रासंगिकता

  • कई लोगों का तर्क है कि IQ परीक्षण LLMs का मूल्यांकन करने का खराब तरीका हैं: ये मनुष्यों के लिए, विशेष रूप से क्षमता के एक संकीर्ण दायरे के भीतर, डिज़ाइन और मान्य किए गए थे, न कि अलग आर्किटेक्चर वाली मशीन प्रणालियों के लिए।
  • अन्य लोग नोट करते हैं कि IQ (और g factor) अभी भी मानव बुद्धि और जीवन परिणामों का सबसे मज़बूत अनुभवजन्य रूप से मान्य प्रॉक्सी है, इसलिए यह कम-से-कम एक दिलचस्प बेंचमार्क तो है।
  • मतभेद इस पर केंद्रित हैं कि क्या IQ मुख्यतः पैटर्न पहचान को मापता है या रचनात्मकता, समस्या-समाधान, और “fluid intelligence” जैसी व्यापक क्षमताओं को।
  • कुछ लोग LLM के खराब IQ प्रदर्शन को मॉडलों की तुलना में परीक्षणों पर अधिक गंभीर आरोप मानते हैं; अन्य इसे इस बात का स्पष्ट प्रमाण मानते हैं कि LLMs “बुद्धिमान” नहीं हैं।

LLM “बुद्धिमत्ता” की प्रकृति

  • एक दृष्टिकोण: LLMs “सिर्फ अगले टोकन की भविष्यवाणी करने वाले” हैं / वेब टेक्स्ट का हानिपूर्ण संपीड़ित भंडारण हैं, जो नकल करने में अच्छे हैं लेकिन सोचने में नहीं।
  • प्रतिवाद: पूर्ण next-token prediction के लिए अंतर्निहित प्रक्रियाओं की गहरी समझ की आवश्यकता होगी; मौजूदा मॉडल पहले से ही कुछ उभरती हुई तर्क-क्षमता दिखाते हैं।
  • कई लोग नोट करते हैं कि मनुष्य भी अपनी समझ से बाहर होने पर संभाव्य बकवास “हैलुसिनेट” करते हैं, जिससे मानव और मशीन व्यवहार के बीच की सीमा धुंधली हो जाती है।
  • बुद्धिमत्ता की कोई सर्वसम्मत परिभाषा नहीं है, जिससे मूलतः इस बात पर अर्थगत झगड़े होते हैं कि LLMs योग्य हैं या नहीं, या “AGI” हासिल हो चुकी है या नहीं।

दृष्टि और परीक्षण प्रारूप संबंधी समस्याएँ

  • कई लोगों का तर्क है कि IQ के विशिष्ट उदाहरण मुख्यतः दृष्टि/एन्कोडिंग का परीक्षण करते हैं, न कि तर्क का।
  • सुझाव: Raven-शैली की समस्याओं को चित्रों के बजाय टेक्स्ट, JSON, या ASCII art के रूप में प्रस्तुत करें; कुछ प्रयोग दिखाते हैं कि तब मॉडल अक्सर उन्हें सही हल कर लेते हैं, हालांकि stochastic रूप से।
  • image-based प्रश्नों में असफलता की तुलना किसी अंधे व्यक्ति का IQ केवल दृश्य पहेलियों से जाँचने से की जाती है।

क्षमताएँ, सीमाएँ, और hallucinations

  • LLMs कुछ textual IQ-जैसे कार्यों और कुछ math benchmarks में मनुष्यों के बराबर या उनसे बेहतर कर सकते हैं, लेकिन सटीक अंकगणित, प्रशिक्षण डेटा से परे सामान्यीकरण, और मज़बूत अमूर्त तर्क में संघर्ष करते हैं।
  • उद्धृत शोध से संकेत मिलता है कि बहुत-सा “reasoning” वास्तव में pattern memorization है, हालांकि कुछ वास्तविक तर्क भी मौजूद हो सकता है।

AGI, hype, और भविष्य की दिशा

  • राय “हमारे पास पहले ही औसत-मानव-नकल स्तर की AGI है” से लेकर “LLMs को बहुत बढ़ा-चढ़ाकर पेश किया गया है, ये एक इंच-गहरे पैटर्न मशीन हैं” तक फैली हुई हैं।
  • कुछ लोग दार्शनिक लेबलों की तुलना में व्यावहारिक उपयोगिता (“क्या यह काम कर सकता है?”) पर ज़ोर देते हैं।
  • अन्य लोग तेज़ प्रगति, मस्तिष्कों की तुलना में अभी भी कहीं कम parameter counts, और निकट भविष्य में—विशेषकर vision में—महत्वपूर्ण उन्नति की अपेक्षा पर ज़ोर देते हैं।