Weak-to-Strong Generalization

OpenAI के “weak-to-strong generalization” काम, जिसमें एक कमजोर मॉडल को एक मजबूत मॉडल की supervision के लिए इस्तेमाल किया जाता है ताकि भविष्य की superintelligent प्रणालियों पर मनुष्यों की supervision का प्रॉक्सी बनाया जा सके, इस पर बहस छेड़ रहा है कि क्या AI alignment अवधारणात्मक रूप से भी संभव है। टिप्पणीकार OpenAI के “safe” और “ethical” जैसे शब्दों के उपयोग पर सवाल उठाते हैं, संदेह करते हैं कि मौजूदा LLM आर्किटेक्चर या इंटरनेट-प्रशिक्षित सिस्टम विश्वसनीय रूप से aligned superintelligences बन सकते हैं या बने रह सकते हैं, और mind control, उभरती AI “interests,” तथा ऐसी प्रणालियाँ अंततः किन values की सेवा करेंगी, इस पर चिंता जताते हैं। अन्य लोग तर्क देते हैं कि भले ही नियंत्रण के तंत्र अपूर्ण हों, फिर भी उनका पीछा करना सार्थक है, क्योंकि अत्यधिक सक्षम AI—aligned हो या नहीं—का दुरुपयोग खतरनाक हो सकता है या श्रम और सत्ता संरचनाओं को बदल सकता है.

OpenAI का सुरक्षा पर ध्यान और शासन

  • कुछ लोग हालिया बोर्डरूम उथल-पुथल के बावजूद alignment पर काम जारी रहने का स्वागत करते हैं, लेकिन अन्य लोगों को चिंता है कि सुरक्षा-केंद्रित नेतृत्व को बाहर कर दिया गया और व्यावसायिक प्रोत्साहन हावी हो जाएंगे।
  • कई टिप्पणीकार तर्क देते हैं कि “safety” ज़्यादातर PR है: व्यवहार में इसका मतलब मुकदमों और खराब प्रचार से बचना होता है, न कि गहरी नैतिकता।
  • “safe,” “aligned,” “controlled,” और “ethical” जैसे शब्दों को धुंधला, कंपनी-अपेक्षिक, और अक्सर बिना स्पष्ट परिभाषाओं के आपस में अदल-बदल योग्य माना जाता है।

Weak-to-Strong Supervision का विचार

  • पेपर का मूल सेटअप—एक कमजोर मॉडल से एक मजबूत मॉडल की supervision कराना (उदाहरण के लिए GPT-2 द्वारा GPT-4 की supervision)—को मानव द्वारा AGI की supervision का एक प्रॉक्सी माना जाता है।
  • कुछ लोग इसे एक plausible शुरुआती बिंदु मानते हैं: हम उन कमजोर प्रणालियों को align कर सकते हैं जिन्हें हम समझते हैं, फिर उसे bootstrap कर सकते हैं।
  • आलोचक “turtles all the way down” की चिंता उठाते हैं: यदि कमजोर प्रणाली स्वयं अच्छी तरह aligned नहीं है, तो पूरी stack compromised हो जाती है।
  • अन्य लोग सुझाव देते हैं कि यह योजना बस मजबूत प्रणाली को कमजोर प्रणाली जैसा व्यवहार करने तक सीमित कर सकती है, प्रभावी रूप से उसे “dumb down” कर सकती है।

क्या superhuman AGI को align किया जा सकता है?

  • एक पक्ष का दावा है कि वास्तविक critical thinking और वैकल्पिक value systems को खोजने की क्षमता वाला entity अनिवार्य रूप से imposed goals पर सवाल उठाएगा या उन्हें अस्वीकार कर देगा; reliable alignment असंभव हो सकती है।
  • विरोधी कहते हैं कि यह तार्किक रूप से सिद्ध नहीं है; एक प्रणाली misalignment को गहराई से समझ सकती है, फिर भी aligned values के प्रति दृढ़तापूर्वक प्रतिबद्ध रह सकती है।
  • बहस इस बात पर केंद्रित है कि क्या reasoning की कुछ lines को सीमित करने से सामान्य intelligence अनिवार्य रूप से कम हो जाती है।

LLMs की सीमाएँ और AGI तक के रास्ते

  • संदेहवादी तर्क देते हैं कि मुख्यतः text outputs पर प्रशिक्षित LLMs में causal grounding, उचित compositional reasoning, और out-of-distribution robustness की कमी होती है, इसलिए वे AGI से पहले एक ceiling पर पहुँच जाएँगे।
  • अन्य जवाब देते हैं कि मनुष्य भी बड़े पैमाने पर linguistic outputs से सीखते हैं, और rich outputs पर training (multimodal data सहित) अंतर्निहित संरचना को अप्रत्यक्ष रूप से पकड़ सकती है।
  • इस पर असहमति है कि क्या models कभी अपने human creators के “collective knowledge” या sophistication से आगे निकल सकते हैं।

“Mind Control” और AI Rights की नैतिकता

  • कुछ लोग तर्क देते हैं कि एक self-aware AI के “thoughts” को सक्रिय रूप से फिर से लिखना अनैतिक होगा, mind control या slavery के समान; वे human-rights शैली के तर्कों को किसी भी self-aware intelligence तक विस्तारित करते हैं।
  • अन्य लोग जवाब देते हैं कि वर्तमान और foreseeable प्रणालियों में भावनाएँ या इच्छाएँ नहीं होतीं, इसलिए control एक व्यावहारिक safety measure है, जो मनुष्यों में training या impulse control जैसा है।
  • पूरी तरह “cold tools” बनाने, जिनमें कोई aspirations न हों, और ऐसी entities बनाने के बीच तनाव है जो moral consideration का जायज़ दावा कर सकती हैं।

Alignment और Superalignment का अर्थ

  • टिप्पणीकार पूछते हैं: aligned किसके साथ और किन values के साथ—corporations, governments, सामान्य रूप से “humanity”?
  • चूँकि मनुष्य स्वयं aligned नहीं हैं और नियमित रूप से नुकसान पहुँचाते हैं, कुछ लोग एक कहीं अधिक सक्षम intelligence को align करने के वादे को “laughable” मानते हैं।
  • “Superalignment” को कुछ लोग एक आवश्यक दीर्घकालिक research direction मानते हैं, और अन्य लोग इसे निकट भविष्य के मुद्दों जैसे misuse, economic disruption, और current model failures की तुलना में overhyped मानते हैं।