ARC-AGI लीडरबोर्ड
Anthropic के Opus 5 को अन्य मॉडलों से काफी आगे दिखाने वाला एक नया ARC-AGI leaderboard इस बात की जाँच-पड़ताल को जन्म दे रहा है कि AI benchmarks अभी भी कितने विश्वसनीय हैं। टिप्पणीकार सवाल उठाते हैं कि क्या मॉडलों को समान puzzles पर training, hidden prompt scaffolds, या leaked test data के जरिए “benchmaxx” किया जा रहा है, और बहस करते हैं कि ARC-AGI के game-like tasks सचमुच general intelligence मापते हैं या सिर्फ एक संकीर्ण genre पर प्रदर्शन। यह चर्चा closed-model data retention promises, official scores से harnesses और agents के बहिष्कार, और frontier models के impressive benchmark results तथा उनकी दिन-प्रतिदिन की उपयोगिता के perceived अंतर पर भी चिंता सामने लाती है.
Opus 5 का ARC-AGI-3 प्रदर्शन और विश्वसनीयता
- टिप्पणीकार Opus 5 और ARC-AGI-3 पर अन्य मॉडलों के बीच बहुत बड़े अंतर की ओर इशारा करते हैं; कुछ लोग इन कार्यों को आज़माने के बाद इसे “crazy” मानते हैं।
- अन्य लोग इसकी संभाव्यता पर सवाल उठाते हैं: वर्तमान खुले प्रयास (जैसे, Kaggle) reportedly भारी कंप्यूट के साथ ~2% तक ही पहुँचते हैं, और सार्वजनिक उपसमुच्चयों पर कुछ “99%” दावों को अप्रमाणित माना जाता है।
- कई लोगों को संदेह है कि यह व्यापक “general intelligence” छलांग के बजाय ARC-AGI-3 जैसी कार्य-शैली पर लक्षित प्रशिक्षण है।
Benchmaxxing, contamination, और private datasets
- यह लगातार चिंता बनी हुई है कि benchmarks को memorization, genre-specific training, या hidden instructions के जरिए आसानी से “benchmaxx” किया जा सकता है।
- कुछ लोगों का तर्क है कि Opus 5 का व्यवहार (template जैसी tasks पर perfect, नई tasks पर खराब) general reasoning gains के बजाय genre-specific data पर training जैसा दिखता है।
- अन्य लोग contamination को साबित करने की कठिनाई की ओर ध्यान दिलाते हैं; private/semi-private splits मौजूद हैं, लेकिन वे traces, harness reading, या user-shared data के माध्यम से फिर भी leak हो सकते हैं।
Harnesses बनाम single-prompt evaluation
- मॉडलों के चारों ओर “harnesses” (tool-using wrappers) की अनुमति देने पर बहस।
- एक पक्ष: harnesses प्रदर्शन पर हावी हो जाते हैं, इसलिए benchmarks मॉडल को नहीं, wrapper को मापते हैं; ARC-specific harnesses की अनुमति देने से AGI में “G” टूट जाता है।
- दूसरा पक्ष: मनुष्य tools का उपयोग करते हैं; harnesses पर रोक लगाने से benchmark वास्तविक दुनिया के agent systems के लिए कम प्रासंगिक हो जाता है। कुछ लोग सुझाव देते हैं कि मॉडलों को session के भीतर अपने खुद के tools बनाने दिए जाएँ।
Data retention, Fable, और trust
- Fable अनुपस्थित है क्योंकि उसकी data retention policy ने reportedly semi-private set के सुरक्षित उपयोग को रोक दिया था।
- कई टिप्पणीकार प्रमुख labs के “no training” आश्वासनों पर भरोसा नहीं करते, हालांकि एक व्यक्ति नोट करता है कि zero-retention का दावा अदालत में टिक गया था।
- कुछ लोग “never stored” और “stored then deleted” के बीच अंतर करने की कठिनाई उठाते हैं।
User experience बनाम benchmark gains
- उपयोगकर्ताओं का एक हिस्सा महसूस करता है कि नए models benchmark पर बेहतर हैं, लेकिन पुराने models की तुलना में वे काफी अधिक उपयोगी नहीं लगते, या constraints और hedging के कारण “worse” भी लगते हैं।
- अन्य लोग स्पष्ट सुधारों की रिपोर्ट करते हैं (जैसे niche technical reasoning में) और perceived stagnation को hedonic adaptation से जोड़ते हैं।
क्या ARC-AGI एक अच्छा benchmark है?
- आलोचक कहते हैं कि ARC-AGI-3 game-like puzzles पर अत्यधिक निर्भर है, human gameplay conventions मानकर चलता है, और text-centric LLM strengths के साथ खराब तरीके से aligned है।
- समर्थकों का तर्क है कि game-like, novel interactive tasks ही generalization और tool-free reasoning को परखने के लिए ठीक वही हैं जिनकी आवश्यकता है।
Costs, incentives, और AGI rhetoric
- कुछ लोग reported evaluation costs (tens of thousands of dollars तक) से हैरान हैं।
- यह cynicism है कि massive financial stakes और “AGI/ASI” marketing benchmarks पर overfit करने या धोखा देने के लिए मजबूत incentives पैदा करते हैं।
- कुछ का तर्क है कि AGI अभी भी 10–20 साल दूर है और मौजूदा systems advanced pattern-matching हैं, true general intelligence नहीं।