A* से परे: ट्रांसफॉर्मर्स के साथ बेहतर योजना बनाना
शोधकर्ता यह जाँच रहे हैं कि क्या transformer मॉडल, अपनी execution traces से सीखकर, A* जैसे क्लासिक path-planning algorithms से बेहतर प्रदर्शन कर सकते हैं, जैसे maze-solving और Sokoban puzzles में। टिप्पणीकार इस दृष्टिकोण को बौद्धिक रूप से रोचक मानते हैं, खासकर heuristics सीखने या पारंपरिक search विधियों को मार्गदर्शन देने के तरीके के रूप में, लेकिन वे यह भी नोट करते हैं कि रिपोर्ट की गई 26.8% search-step कमी संभवतः कहीं अधिक computational cost और A* की तुलना में कमजोर optimality guarantees के साथ आती है। यह बातचीत व्यापक प्रश्न उठाती है कि कब अच्छी तरह समझे गए symbolic algorithms को भारी neural models से बदलना उचित है, और क्या ऐसा काम व्यावहारिक प्रदर्शन को आगे बढ़ाता है या मुख्यतः transformers की लचीलापन क्षमता को दर्शाता है।
मॉडल नामकरण और शब्दावली
- कई टिप्पणीकार “Searchformer” नाम को पसंद नहीं करते; वे वैकल्पिक नाम सुझाते हैं (जैसे, planning-थीम वाले नाम, “T*”), और पहले के कार्यों से नामों के टकराव की ओर ध्यान दिलाते हैं।
- कुछ लोग तर्क देते हैं कि A* विरासत के कारण “Search” उपयुक्त है; जबकि अन्य कहते हैं कि “Planning” प्रतीकात्मक-योजना (symbolic-planning) की शब्दावली से बेहतर मेल खाएगा और सूचना-पुनर्प्राप्ति वाले “search” से भ्रम भी कम करेगा।
- नामकरण, ट्रेडमार्क, और ट्रांसफॉर्मर-थीम वाले नामों की बढ़ती संख्या पर चुटकुले भी किए गए।
A और शास्त्रीय खोज के मुकाबले प्रदर्शन*
- पेपर में Sokoban और maze कार्यों पर A* खोज-चरणों की संख्या कम होने का दावा किया गया है; टिप्पणीकारों का कहना है कि इसका मतलब यह नहीं कि वास्तविक समय (wall-clock time) भी कम होगा।
- कई प्रतिभागियों का कहना है कि A* का प्रति-चरण खर्च ट्रांसफॉर्मर चलाने की तुलना में नगण्य है; विशेषकर इसलिए भी कि wall-clock समय रिपोर्ट नहीं किए गए, उन्हें किसी गति-लाभ पर संदेह है।
- A* के अपने मान्यताओं के अंतर्गत इष्टतम होने और यह कि डोमेन-विशिष्ट तरीके (जैसे Jump Point Search) संरचना का लाभ उठाकर इसे पछाड़ सकते हैं, इस पर चर्चा हुई।
सीखी हुई heuristics और हाइब्रिड दृष्टिकोण
- A*, branch-and-bound, ILP, SAT, और अन्य discrete optimizers के लिए heuristics या tie-breakers देने हेतु learned models के उपयोग में गहरी रुचि दिखाई गई।
- कई टिप्पणीकार हाइब्रिड प्रणालियों को प्राथमिकता देते हैं: सिद्ध एल्गोरिद्म को बनाए रखें, और उन्हें पूरी तरह बदलने के बजाय ML-सीखी heuristics से बढ़ाएँ।
- कुछ लोग इस पेपर को search strategies को हाथ से गढ़ने के बजाय डेटा-आधारित, generic तरीके से tune करने की दिशा में एक कदम मानते हैं।
Sokoban, benchmarks, और वैज्ञानिक मूल्य
- आलोचकों का कहना है कि Sokoban के SOTA solvers साधारण A* से बहुत बेहतर हैं, इसलिए vanilla A* को हराना एक मामूली परिणाम है।
- इस बात पर प्रश्न उठाए गए कि यदि पेपर मूलतः A* traces की नकल करता है और उन्हें एक constant factor से बेहतर बनाता है, तो इसका वैज्ञानिक योगदान कितना है।
- अन्य लोग जवाब देते हैं कि शोध का SOTA होना जरूरी नहीं; यह एक नया framing दिखा सकता है (execution traces पर transformers) और आगे के काम को प्रेरित कर सकता है।
इष्टतमता, असुलझनीयता, और सीमाएँ
- चिंता है कि transformer-आधारित planners स्वाभाविक रूप से इष्टतमता या समाधान-रहित होने का प्रमाण नहीं दे सकते, जबकि सीमित spaces में A* दे सकता है।
- transformers की मजबूत प्रकार की तार्किक नकार (logical negation) और guarantees के साथ कठिनाइयों पर चर्चा हुई।
- कुछ लोग इस काम को transformers की आश्चर्यजनक सामान्यता के प्रमाण के रूप में देखते हैं; अन्य लोग generative-AI की सफलता को सभी planning/optimization समस्याओं पर लागू मान लेने से सावधान करते हैं।