इंटेल और अमेरिकी सरकार समर्थित एक ट्रिलियन-परामीटर मॉडल के लिए प्रशिक्षण शुरू हो गया है
अमेरिकी सरकार समर्थित एक परियोजना, जिसमें Intel शामिल है, ने Aurora सुपरकंप्यूटर पर एक ट्रिलियन-पैरामीटर AI मॉडल का प्रशिक्षण शुरू कर दिया है, जिसका लक्ष्य GPT‑4 जैसी प्रणालियों की बराबरी करना या उनके करीब पहुँचना और वैज्ञानिक शोध को आगे बढ़ाना है। टिप्पणीकार इस पर बहस कर रहे हैं कि क्या और बड़े मॉडल सही रास्ता हैं या नए आर्किटेक्चर और प्रशिक्षण विधियों की ज़रूरत है, और यह भी कि क्या उच्च-गुणवत्ता वाला डेटा इतना है कि स्केलिंग और आगे बढ़ सके। यह प्रयास शक्तिशाली AI पर राज्य नियंत्रण, निगरानी किए गए या वर्गीकृत डेटा के संभावित उपयोग, परिणामी मॉडल की openness, और AI को लगातार बढ़ाने के व्यापक सामाजिक जोखिमों बनाम लाभों को लेकर भी चिंताएँ उठाता है.
मॉडल का पैमाना, आर्किटेक्चर, और तुलना
- कुछ लोग ध्यान दिलाते हैं कि 1T पैरामीटर इसे केवल GPT‑4 की श्रेणी में रख सकते हैं, उससे आगे नहीं; GPT‑4 का वास्तविक आकार और उसका Mixture‑of‑Experts (MoE) होना या न होना अभी भी अपुष्ट और बहस का विषय है।
- कई लोग बताते हैं कि अभी तक ज्ञात सभी 1T+ मॉडल MoE हैं; यह नया मॉडल dense है या MoE, यह स्पष्ट नहीं है, लेकिन तुलना के लिए बहुत महत्वपूर्ण है।
- स्केलिंग परिकल्पना का व्यापक रूप से उल्लेख किया जाता है: अब तक, “बड़ा मॉडल + अधिक डेटा + अधिक compute” विश्वसनीय रूप से क्षमता में सुधार करता है, हालांकि बहुत से लोग अंततः सीमाएँ आने की उम्मीद करते हैं।
- अन्य लोगों का तर्क है कि भविष्य के लाभों के लिए केवल अधिक पैरामीटर नहीं, बल्कि आर्किटेक्चर में बदलाव और बेहतर डेटा दक्षता की आवश्यकता होगी।
डेटा, प्रशिक्षण, और मानव तुलना
- इस पर बहस है कि क्या हम “डेटा से खत्म” हो रहे हैं; कुछ का दावा है कि बड़े लैब अभी भी पर्याप्त डेटा खोज या उत्पन्न कर सकते हैं, जबकि अन्य सीमाएँ देखते हैं।
- मोटे अनुमानों में मानव संवेदन इनपुट (सैकड़ों TB–PB स्तर) की तुलना LLM प्रशिक्षण कॉर्पस से की जाती है, यह सुझाव देते हुए कि मनुष्य कहीं अधिक कच्चा इनपुट अनुभव कर सकते हैं, लेकिन अधिक इंटरैक्टिव और मल्टीमोडल तरीकों से।
- कई लोग इस बात पर ज़ोर देते हैं कि मनुष्य वास्तविक दुनिया के साथ सक्रिय संवाद और फीडबैक से सीखते हैं, केवल पाठ से नहीं; कुछ का सुझाव है कि भविष्य की AI को भी उच्च बुद्धिमत्ता तक पहुँचने के लिए इसी तरह वातावरणों में कार्य करना होगा।
सुपरकंप्यूटर और हार्डवेयर
- Intel/Argonne की Aurora प्रणाली को Intel GPUs और विशाल parallelism के प्रदर्शन के रूप में देखा जा रहा है।
- इस पर चर्चा है कि क्या पारंपरिक सुपरकंप्यूटर आर्किटेक्चर (जैसे HPC interconnects, FP64 bias) LLM प्रशिक्षण के लिए आदर्श हैं, बनिस्बत बड़े GPU clusters के; राय मिली-जुली है।
लाभ और वैज्ञानिक लक्ष्य
- बहुत से लोग किसी domain-specific, विज्ञान-प्रशिक्षित मॉडल को लेकर आशावादी हैं: बेहतर साहित्य खोज, स्वायत्त खोज, और शोध की गति में वृद्धि।
- कुछ लोग इसे सार्वजनिक-क्षेत्र AI परियोजनाओं में सबसे आकर्षक परियोजनाओं में से एक मानते हैं।
जोखिम, नैतिकता, और शासन
- मजबूत “AI doomer” दृष्टिकोण तर्क देते हैं कि AI शुद्ध हानि है, और इसकी तुलना रासायनिक हथियारों तथा व्यापक तकनीकी नुकसानों (जलवायु, प्लास्टिक, औद्योगिक कृषि) से करते हैं।
- अन्य लोग जवाब देते हैं कि तकनीक (AI सहित) बड़े लाभ लाती है, और समस्याएँ आम तौर पर दुरुपयोग, अर्थव्यवस्था, और governance से उत्पन्न होती हैं, न कि विज्ञान स्वयं से।
- इस पर महत्वपूर्ण बहस है कि शक्तिशाली AI को नियंत्रित करने के लिए सरकारें या कॉरपोरेशन कम बुराई हैं या नहीं, जिसमें राज्य बनाम कॉरपोरेट अत्याचारों पर व्यापक ऐतिहासिक तर्क शामिल हैं।
- निगरानी डेटा को लेकर चिंताएँ उठाई गई हैं: कुछ लोग अनुमान लगाते हैं कि खुफिया एजेंसियाँ दशकों के संचार पर शक्तिशाली, निजी मॉडल प्रशिक्षित कर सकती हैं; इसे चिंताजनक बताया गया है लेकिन अपुष्ट है।
खुलापन, पहुँच, और सुरक्षा
- इस पर सवाल हैं कि क्या मॉडल weights जारी किए जा सकते हैं या FOIA के तहत प्राप्त किए जा सकते हैं; अधिकांश लोग “राष्ट्रीय सुरक्षा” वर्गीकरण की अपेक्षा करते हैं।
- ओपन मॉडल्स की चाहत और उन्नत क्षमताएँ विरोधियों के हाथों में देने की चिंता के बीच तनाव है।