एलएलएम किस तरह की गणित में अच्छे हैं?
Large language models औपचारिक गणितीय प्रमाणों और counterexample search में मदद करना शुरू कर रहे हैं, फिर भी वे रोज़मर्रा के कई तर्क कार्यों और messy वास्तविक-विश्व समस्याओं में विफल रहते हैं, जैसे job ads की व्याख्या करना या खुले-समाप्ति वाले logic puzzles को संभालना। टिप्पणीकार LLMs की well-specified systems के भीतर pattern matching, code और theorem-proving में मजबूती की तुलना general reasoning benchmarks, spatial understanding और nuanced instructions को भरोसेमंद ढंग से पालन करने में उनकी कमजोरी से करते हैं। इससे इस पर बहस होती है कि क्या मौजूदा systems “general intelligence” के योग्य हैं, प्रगति का कितना हिस्सा brute-force search plus verification से आ रहा है, और क्या भविष्य के models कभी सचमुच नए, elegant mathematical ideas उत्पन्न कर पाएँगे या केवल incremental या brute-force परिणाम ही देंगे।
एलएलएम क्षमताओं का दायरा
- कई टिप्पणीकार इन बातों के बीच अंतर करते हैं:
- औपचारिक, बंद-डोमेन कार्यों में मजबूत प्रदर्शन (गणित, कोड, औपचारिक प्रमाण, Lean)।
- खुले-समाप्ति वाले “सामान्य दुनिया” के कार्यों में कमजोर, असंगत प्रदर्शन (नौकरी खोज, सामान्य तर्क, सामान्य बुद्धि)।
वास्तविक-विश्व कार्य विफलताएँ बनाम प्रॉम्प्ट गुणवत्ता
- एक टिप्पणीकार ने एक seemingly सरल agentic task में frontier models की विफलता रिपोर्ट की: एक विशिष्ट देश में freelance IT consulting gigs ढूँढ़ना, जिसमें यह गड़बड़ी हो गई:
- Freelance बनाम permanent roles।
- Job location बनाम agency location।
- अन्य लोग इसका विरोध करते हैं कि:
- वर्णित प्रॉम्प्ट को पार्स करना कठिन है; वास्तविक प्रॉम्प्ट गुणवत्ता अज्ञात है।
- डेटा गुणवत्ता और scraping की अस्पष्टता (job boards, agencies) संभवतः मायने रखती है।
- एक व्यापक बात यह है कि messy वास्तविक-विश्व workflows के लिए end-to-end LLM agents अभी भी brittle हैं और उन्हें decomposed, verifiable pipelines की ज़रूरत होती है।
तर्क बेंचमार्क और सीमाएँ
- उद्धृत बेंचमार्क (General365, ARC‑AGI‑3) दिखाते हैं कि:
- background knowledge नियंत्रित होने पर frontier models विविध तर्क कार्यों में मनुष्यों से काफी नीचे स्कोर करते हैं।
- उदाहरण पहेलियाँ मनुष्यों के लिए भी अत्यंत कठिन हैं; कुछ लोग 60%+ accuracy को प्रभावशाली मानते हैं, जबकि अन्य इसे “AGI” के विरुद्ध साक्ष्य मानते हैं।
- आलोचना की एक और धारा यह है कि LLMs irrelevant context से आसानी से distract हो जाते हैं; लंबे, अधिक verbose prompts नुकसान पहुँचा सकते हैं।
गणित, प्रमाण, और “Brute Force” बनाम अंतर्दृष्टि
- हाल के LLM-सहायता प्राप्त गणितीय परिणामों की चर्चा इस पर ज़ोर देती है कि:
- generate-and-test, कई sub-agents, हजारों scripts/commands का भारी उपयोग।
- कुछ इसे glorified brute-force search मानते हैं; अन्य इसे evolution जैसी iterative heuristic search के रूप में देखते हैं।
- LLMs को इस तरह देखा जाता है कि वे:
- मामलों को खँगालने, counterexamples खोजने, और verifiers/SAT solvers के साथ लंबे formal proofs बनाने में उत्कृष्ट हैं।
- लेकिन अभी तक स्पष्ट रूप से नए, गहरे “elegant” concepts पैदा करने में सक्षम नहीं हैं (जैसे Fourier transform के analogue)।
बुद्धिमत्ता, AGI, और भरोसा
- एक पक्ष का तर्क है कि:
- व्यापक विश्व-ज्ञान + simulated reasoning + cross-domain transfer पहले से ही उनके व्यक्तिगत मानदंड के अनुसार “AGI” के बराबर है।
- आलोचक जवाब देते हैं कि:
- child-level abstraction tasks और व्यावहारिक brittleness में विफलता इस दावे के विरुद्ध है।
- सच्चे AGI को मानव safety nets के बिना उच्च-दांव engineering (bridges, planes, warfare) के लिए भरोसेमंद होना चाहिए, जो वर्तमान वास्तविकता से बहुत दूर है।
- कई लोग नोट करते हैं कि human expertise अभी भी LLMs को guide करने और परिणामों को verify करने दोनों के लिए आवश्यक है; सामान्य उपयोगकर्ता शायद ही कभी breakthrough हासिल करते हैं।
मेटा-अवलोकन
- LLMs को “plausible human-like reasoning traces” के शक्तिशाली जनरेटर के रूप में देखा जाता है जो stochastic search को बेहतर बना सकते हैं, लेकिन:
- वे systematic, multi-step reasoning में, विशेषकर लंबे chains या concurrency/temporal logic में, अभी भी त्रुटिपूर्ण हैं।
- machine-generated proofs और results की आने वाली बाढ़ को लेकर चिंता है, जिन्हें केवल एक बहुत छोटा विशेषज्ञ समुदाय ही verify कर पाएगा।