ARC-AGI-3 पर OpenAI का GPT-6 Astra

OpenAI का GPT‑6 “Astra” मॉडल कथित तौर पर ARC‑AGI‑3 तर्क बेंचमार्क पर लगभग-पूर्ण प्रदर्शन हासिल करता है, जिससे इस पर बहस छिड़ती है कि क्या ऐसे परिणाम कृत्रिम सामान्य बुद्धिमत्ता के आगमन का संकेत हैं या फिर केवल एक और संकीर्ण परीक्षण की संतृप्ति। टिप्पणीकार ARC‑AGI‑3 को “बुद्धिमत्ता” के प्रॉक्सी के रूप में कितना अर्थपूर्ण है, इस पर सवाल उठाते हैं, AI की लागत और क्षमताओं की मनुष्यों से तुलना करते हैं, और नोट करते हैं कि बेहतर reasoning retries घटाकर कुल compute लागत को विरोधाभासी रूप से कम कर सकता है। चर्चा आगे बढ़कर इस पर जाती है कि क्या AGI की अवधारणा ही सुसंगत है, इसे कैसे परिभाषित किया जाना चाहिए (जैसे आर्थिक रूप से मूल्यवान काम बनाम सामान्य समस्या-समाधान), और कौन से कठिन बेंचमार्क—जैसे खुले Erdős गणितीय समस्याएँ या embodied robotics—अब भी मौजूदा मॉडलों की पहुँच से बाहर हो सकते हैं।

लागत, हार्नेस डिज़ाइन, और प्रदर्शन

  • “उलटी” लागत/स्कोर वक्र ARC-AGI-3 के retry-आधारित सेटअप से समझाई जाती है: हर चाल पर अधिक तर्क-वितर्क कम प्रयासों में पहेलियाँ हल कर देता है, जिससे कुल टोकन घटते हैं और इसलिए लागत भी कम होती है।
  • आधिकारिक ARC हार्नेस पहले के तर्क/संदर्भ को हटा देता है, जिससे मॉडल को हर खेल “फिर से सीखना” पड़ता है। OpenAI का कस्टम हार्नेस मानक context compaction और reuse जोड़ता है, जिससे स्कोर में बहुत बड़ा सुधार होता है।
  • कुछ लोग नोट करते हैं कि “सही हार्नेस के साथ” Astra ~99.9% तक पहुँचता है, जिससे दावे उठते हैं कि इससे यह इस बेंचमार्क पर प्रभावी रूप से AGI तक पहुँच जाता है, जबकि अन्य लोग इंगित करते हैं कि इसमें हार्नेस डिज़ाइन बहुत काम कर रहा है।

मानव बनाम AI लागत और दक्षता

  • मनुष्यों के प्रति सत्र वेतन और मस्तिष्क की ऊर्जा लागत की तुलना बहस छेड़ती है: कुछ लोग जैविक दक्षता का उत्सव मनाते हैं; अन्य तर्क देते हैं कि केवल मस्तिष्क-ऊर्जा की तुलना प्रशिक्षण, शिक्षा, और सीमित कार्य घंटों को अनदेखा करती है।
  • कई लोग इस बात पर ज़ोर देते हैं कि मानव समय intrinsically मूल्यवान है और सस्ते AI टोकनों से सीधे तुलनीय नहीं है।

क्या यह AGI है? परिभाषाएँ और हिलते लक्ष्य-स्तंभ

  • कई लोग तर्क देते हैं कि AGI अस्पष्ट परिभाषित है या मुख्यतः एक मार्केटिंग शब्द है; लोग उस पर अपना-अपना अर्थ थोपते हैं।
  • उठाई गई परिभाषाओं में शामिल हैं: “ऐसी प्रणालियाँ जो संज्ञानात्मक कार्यों में मानव बुद्धिमत्ता के बराबर या उससे ऊपर हों” और “अत्यधिक स्वायत्त प्रणालियाँ जो अधिकांश आर्थिक रूप से मूल्यवान काम में मनुष्यों से बेहतर हों,” जिन दोनों को धुंधला बताया गया।
  • कुछ कहते हैं कि यदि एक हार्नेस मॉडल को ARC-AGI-3 पर 99.9% तक पहुँचा सकता है, तो हम प्रभावी रूप से AGI पर हैं; अन्य ज़ोर देते हैं कि AGI तब होगा जब हम ऐसा कोई काम ही न सोच सकें जो मनुष्यों के लिए आसान लेकिन मशीनों के लिए कठिन हो।

बेंचमार्क वास्तव में क्या मापते हैं?

  • इस पर बहस कि क्या साँप-जैसे पहेली गेम या ARC-शैली के लॉजिक कार्य हल करने से “बुद्धिमत्ता” या वास्तविक दुनिया की उपयोगिता के बारे में बहुत कुछ पता चलता है।
  • आलोचकों का कहना है कि मनुष्यों को गति के लिए अनुकूलित किया गया था (उन्हें बताया गया कि वे समयबद्ध हैं), जबकि मॉडल को शुद्धता और लागत के लिए अनुकूलित किया गया है, जिससे तुलना असममित हो जाती है।
  • कई लोगों का अनुमान है कि केवल सॉफ़्टवेयर-आधारित बेंचमार्क संतृप्त हो जाएँगे; प्रस्तावों में रोबोटिक्स कार्य या लंबी अवधि के लक्ष्य (जैसे पैसा कमाना, मेट्रिक्स सुधारना) अधिक सार्थक परीक्षण के रूप में शामिल हैं।

बुद्धिमत्ता, IQ, और वैकल्पिक मेट्रिक्स

  • IQ पर लंबा उप-थ्रेड: कुछ लोग IQ परीक्षणों को मनुष्यों के भीतर विश्वसनीय और परिणामों से संबद्ध मानते हैं; अन्य कहते हैं कि वे “बुद्धि,” सामाजिक कौशल, या गैर-मानवीय बुद्धिमत्ता (जैसे डॉल्फ़िन, ऑक्टोपस) को खराब ढंग से मापते हैं।
  • ARC पहेलियों की तुलना IQ/स्थानिक परीक्षणों से की जाती है: बुद्धिमत्ता के एक “रूप” के लिए उपयोगी, लेकिन स्पष्ट रूप से पूरी कहानी नहीं।
  • कुछ लोग ओपन गणितीय बेंचमार्क (जैसे Erdős समस्याएँ) को overfitting के प्रति अधिक प्रतिरोधी और frontier reasoning का अधिक संकेतक मानते हैं।

बेंचमार्क संतृप्ति, कठिन समस्याएँ, और compute

  • एक पक्ष का दावा है कि “जो कुछ भी सत्यापित किया जा सकता है, उसे अंततः मॉडल हल कर देंगे”; अन्य लोग आसान-से-सत्यापित लेकिन सीखने में कठिन कार्यों (जैसे पैसा कमाना, सुरक्षित ड्राइविंग, subscriptions का अनुकूलन) का उदाहरण देकर जवाब देते हैं।
  • चर्चा में कहा गया कि कई क्षेत्रों में bottleneck compute नहीं, बल्कि वास्तविक दुनिया के rewards इकट्ठा करने की लागत और जोखिम है (जैसे self-driving में crashes)।

विश्वास, धोखाधड़ी, और फंडिंग संबंधी चिंताएँ

  • कुछ लोग संभावित overfitting या यहाँ तक कि निजी ARC test items के exfiltration के बारे में अनुमान लगाते हैं, बड़े labs के प्रोत्साहनों और पिछले व्यवहार का हवाला देते हुए; यह अभी अप्रमाणित है और तथ्य की बजाय संदेह के रूप में चिह्नित है।
  • यह सवाल उठता है कि substantial compute costs किसने चुकाए; एक उत्तर सुझाव देता है कि OpenAI ने इन evaluations के लिए essentially unlimited API access प्रदान किया।

चेतना और व्यावहारिक उपयोगिता

  • एक साइड बहस पूछती है कि क्या कुछ प्रकार की समस्या-समाधान के लिए कभी चेतना या दर्द महसूस करने की क्षमता आवश्यक है; अधिकांश उत्तर चेतना को बुद्धिमत्ता से orthogonal मानते हैं।
  • कुछ टिप्पणीकार व्यावहारिक संदेह व्यक्त करते हैं: जब तक प्रणालियाँ messy वास्तविक-दुनिया के कार्यों (जैसे टपकते नल की मरम्मत) को स्वायत्त रूप से नहीं संभाल सकतीं, उच्च बेंचमार्क स्कोर अमूर्त लगते हैं।