FunSearch: LLMs का उपयोग करके गणितीय विज्ञानों में नई खोजें करना

DeepMind का नया “FunSearch” सिस्टम बड़े भाषा मॉडलों का उपयोग करके छोटे Python programs को iterative तरीके से उत्पन्न और विकसित करता है, जिन्हें एक automatic scoring function निर्देशित करती है, ताकि cap sets और bin packing जैसी कठिन combinatorial समस्याओं को हल किया जा सके। टिप्पणीकार इस बात पर बँटे हुए हैं कि क्या यह सफलता LLM से मिली वास्तविक नई गणितीय समझ को दर्शाती है या मुख्यतः evolutionary search की शक्ति को, जो केवल सबसे अच्छे code variants रखती है; वे यह भी नोट करते हैं कि इसी तरह के विचार genetic programming और inductive program synthesis में लंबे समय से मौजूद हैं। यह चर्चा इस बारे में व्यापक प्रश्न उठाती है कि hybrid systems में LLMs को उचित श्रेय कैसे दिया जाए, वे वास्तव में कितना “reason” करते हैं, पारंपरिक तरीकों पर उनके मूल्य को साबित करने के लिए कौन से प्रयोग आवश्यक हैं, और वैज्ञानिक खोज तथा AI क्षमताओं के भविष्य के लिए यह कार्यक्षेत्र क्या संकेत देता है।

FunSearch पर समग्र प्रतिक्रिया

  • कई लोगों को यह परिणाम प्रभावशाली लगता है: LLM-निर्देशित खोज ने cap sets और bin packing के लिए state-of-the-art समाधान दिए, और पिछले computational solvers को पछाड़ दिया।
  • अन्य लोग इसे genetic programming / heuristic search पर एक क्रमिक सुधार मानते हैं, न कि कोई क्रांति या “since fire” क्षण।

LLM वास्तव में क्या कर रहा है

  • व्यापक सहमति है कि मुख्य काम evolutionary search + evaluator कर रहे हैं; LLM मुख्यतः random mutations के बजाय code edits सुझाता है।
  • समर्थकों का तर्क है कि LLM महत्वपूर्ण है क्योंकि यह:
    • वाक्यात्मक रूप से सही, plausible दिखने वाले programs बनाता है।
    • एक “cold start” से बचाता है, जहाँ अधिकांश random programs की fitness शून्य होती है।
    • एक “expert-ish” code mutator की तरह काम करता है, यानी programming स्तर पर एक general problem-solver।
  • संशयवादियों का कहना है:
    • LLM केवल code snippets और type signatures देखता है; वह combinatorics का domain expert नहीं है।
    • Ablations की तुलना एक अत्यंत कमजोर random mutation baseline से की गई है, न कि मजबूत, मौजूदा genetic programming systems से।
    • यह अभी भी स्पष्ट नहीं है कि विशिष्ट लाभ LLM से कितना आता है और कितना sheer compute तथा search से।

नवीनता, extrapolation, और “stochastic parrot” बहस

  • कुछ लोग तर्क देते हैं कि यह इस विचार का खंडन करता है कि LLMs केवल training data को दोहराते हैं, और high-dimensional extrapolation तथा स्पष्ट रूप से नई mathematical constructions का हवाला देते हैं।
  • अन्य लोग memorization के प्रमाणों की ओर इशारा करते हैं और इस बात पर जोर देते हैं कि बहुत सारे खराब candidates बनाकर उन्हें filter करना वास्तविक reasoning के समान नहीं है।
  • इस बात पर सहमति है कि LLMs “true understanding” के बिना भी व्यावहारिक रूप से उपयोगी हो सकते हैं।

दायरा, सीमाएँ, और विस्तार

  • FunSearch सबसे अच्छा तब काम करता है जब:
    • एक तेज़, समृद्ध evaluator मौजूद हो।
    • समस्या को एक fixed skeleton में एक छोटे code kernel के evolution के रूप में ढाला जा सके।
  • यह विधि स्पष्ट रूप से proof generation जैसी समस्याओं के लिए अनुपयुक्त है, जहाँ समृद्ध numeric score स्पष्ट नहीं होता।
  • कई टिप्पणियाँ चाहती हैं कि सिस्टम formal proofs (जैसे Lean में) विकसित करे या अधिक symbolic reasoning और classical program synthesis को जोड़े।
  • कुछ लोग practical कमियों की ओर इशारा करते हैं: repo में LLM interface का कोई reference implementation नहीं है और अभी तक कोई स्पष्ट third-party replications भी नहीं हैं।

व्यापक निहितार्थ

  • कुछ लोगों के लिए यह “LLM + tools” या neurosymbolic hybrids के सही मार्ग होने की पुष्टि है।
  • अन्य लोग जोर देते हैं कि यह प्रभावशाली तो है, लेकिन singularity से बहुत दूर है; यह अधिकतर एक शक्तिशाली search-acceleration trick है।