100 क्वेरी में डेटा साइंटिस्ट्स के लिए SQL
100 example queries पर आधारित एक single-page SQL tutorial को relational databases का एक स्पष्ट, व्यावहारिक परिचय माना जा रहा है—जो न केवल aspiring data scientists, बल्कि software engineers के लिए भी उपयोगी है। Commenters पूरक learning resources बताते हैं, non‑equi joins, SQLite-specific syntax, और outer join semantics जैसी तकनीकी बारीकियों की ओर ध्यान दिलाते हैं, और सुझाव देते हैं कि interactive environments या बड़े datasets real-world analytics work को बेहतर दर्शाएंगे। यह चर्चा broader सवाल भी उठाती है कि industry में आज “data scientist” का अर्थ क्या है, और ORMs तथा large language models SQL सीखने और लिखने के तरीके को कैसे बदल रहे हैं।
ट्यूटोरियल की समग्र प्रतिक्रिया
- इसे एक संक्षिप्त, उदाहरण-आधारित SQL गाइड के रूप में व्यापक रूप से सराहा गया है, जो परिचयात्मक पाठ्यक्रम या रिविज़न के लिए उपयुक्त है, और कई उपयोग मामलों में एक सेमेस्टर-लंबे कोर्स की बराबरी कर सकता है या उसे प्रतिस्थापित कर सकता है।
- कुछ लोगों का तर्क है कि यह विशेष रूप से “डेटा साइंटिस्ट्स के लिए” नहीं, बल्कि एक सामान्य SQL/SQLite ट्यूटोरियल है।
- सीखने के परिणाम (joins, window functions, transactions, triggers, JSON, Python/ORMs से DB access) इसे एक मजबूत प्रारंभिक पाठ्यक्रम बनाते हैं।
- “check your understanding” सेक्शनों में दिए गए diagrams विभाजक हैं: कुछ इन्हें बहुत अच्छे मानते हैं, तो कुछ भ्रमित करने वाले।
SQL semantics, correctness, and portability
- कई तकनीकी नुक्ताचीनी और सुधार:
- Temporary tables सामान्यतः connection-scoped होती हैं, जरूरी नहीं कि in-memory हों।
- केवल “सभी left rows रखें, right columns या NULL भरें” के आधार पर left outer joins की परिभाषा अधूरी मानी गई; multiple matches होने पर row duplication का उल्लेख भी होना चाहिए।
- Full outer joins और cross joins को गलत तरीके से एक समान माना गया; ये अलग हैं।
- कुछ queries SQLite-specific features पर निर्भर करती हैं (जैसे aggregates पर
FILTER, quoting rules), इसलिए सभी उदाहरण MySQL/SQL Server/Oracle में portable नहीं हैं।
- ClickHouse पर बहस: कुछ लोग इसकी व्यापक SQL standard features की कमी की आलोचना करते हैं; दूसरे जवाब देते हैं कि कोई भी DB पूरी तरह compliant नहीं होता और ClickHouse joins, anti-joins, UDFs आदि पर जोर देते हैं।
- Time-series / inequality joins पर ध्यान दिया गया; कुछ systems में इन्हें non-equi joins या “ASOF” joins कहा गया है।
Learning resources and practice tools
- कई वैकल्पिक tutorials और practice sites का उल्लेख किया गया है: SQLZoo, Mode’s SQL tutorial, StrataScratch, विभिन्न “SQL mystery” / story-based courses, और अन्य language/tech single-page या notebook-based संसाधन।
- ट्यूटोरियल का डाउनलोड करने योग्य DB (
penguins.db) पसंद किया गया; कुछ लोग और practice data sources तथा interactive queries की मांग करते हैं। - एक macOS app साझा की गई जो users को imported CSVs पर SQL चलाने देती है, जिसे hands-on learning tool माना गया।
LLMs और SQL
- कई commenters ने ChatGPT/LLMs का उपयोग करके मजबूत सफलता रिपोर्ट की है, ताकि वे:
- plain-English specs से complex queries generate कर सकें।
- बहुत लंबी, messy queries को refactor या explain कर सकें।
- मुश्किल JSON transformations संभाल सकें।
- अन्य लोग skeptical हैं, “database professional”-level SQL को “data scientist-style” queries से बेहतर मानते हैं, और एक व्यक्ति तिरस्कारपूर्वक “just use ChatGPT” कहकर सीखने से बचने का सुझाव देता है।
“data scientist” label पर बहस
- “data scientist” का आज क्या अर्थ है, इस पर एक लंबी side discussion हुई:
- कुछ लोग पहले की अपेक्षाएँ याद करते हैं: मजबूत quantitative के साथ मजबूत software engineering skills (जैसे deep learning models implement करने में सक्षम होना)।
- अन्य तर्क देते हैं कि यह शब्द हमेशा अस्पष्ट रहा है, statistician, analyst, ML engineer, और data engineer से ओवरलैप करता रहा है।
- कई लोग bootcamps और analyst भूमिकाओं के “data science” के रूप में rebranding द्वारा इस title के dilution को नोट करते हैं।
- कई taxonomies प्रस्तावित की गईं जो coding, math, और domain-expertise स्तरों के आधार पर data scientists, ML engineers, data engineers, और analysts को अलग करती हैं।
- कुछ का कहना है कि data scientists को SQL में बहुत मजबूत होना चाहिए; अन्य नोट करते हैं कि बड़े संगठनों में अब जिम्मेदारियाँ अधिक specialized roles में विभाजित हो गई हैं।