Show HN: मैंने 25M Shopify प्रोडक्ट्स स्क्रैप करके एक सर्च इंजन बनाया

एक side project, जिसने लगभग 650,000 Shopify stores से 25 million products स्क्रैप करके एक स्वतंत्र product search engine बनाया, ने तकनीकी जिज्ञासा और इसकी लंबी अवधि की व्यवहार्यता को लेकर संदेह—दोनों—जगाए। टिप्पणीकारों ने dissect किया कि creator ने store lists कैसे हासिल कीं, public JSON endpoints का उपयोग कैसे किया, और MongoDB-आधारित महंगा stack क्यों चुना, जबकि scaling और बेहतर relevance के लिए Elasticsearch, Typesense, Meilisearch, या Postgres जैसे सस्ते, तेज़ विकल्प सुझाए। कई लोगों ने उत्पाद को Shopify के अपने Shop app और Amazon से अलग पहचान देने पर भी सवाल उठाया, यह तर्क देते हुए कि सफलता crawling scale से कम और search quality, curation, fraud filtering, तथा shoppers और merchants दोनों के लिए एक स्पष्ट value proposition पर अधिक निर्भर करेगी.

स्क्रैपिंग का तरीका और डेटा स्रोत

  • Shopify स्टोर्स मानकीकृत JSON endpoints (/products.json, /meta.json) एक्सपोज़ करते हैं, इसलिए स्क्रैपिंग का मतलब ज़्यादातर HTML के बजाय इन्हें डाउनलोड करना होता है।
  • कई टिप्पणीकारों का कहना है कि आप /products.json को बहुत कम rate limiting के साथ “hammer” कर सकते हैं; पारंपरिक anti-bot समस्याएँ (CAPTCHA, IP bans) यहाँ कम होती हैं।
  • शुरुआती स्टोर सूची एक पेड “BuiltWith” dataset (~2M stores) से आई, फिर geography और revenue के आधार पर फ़िल्टर की गई; अन्य लोग DNS patterns, products.json की मौजूदगी, या Shopify-specific URL structures को detection methods के रूप में बताते हैं।
  • कुछ लोग robots.txt और sitemaps को अतिरिक्त discovery mechanisms के रूप में चर्चा करते हैं, लेकिन एक व्यक्ति “do-not-scrape” hints को seed data के रूप में इस्तेमाल करने पर सवाल उठाता है।

Tech stack, cost & performance

  • मौजूदा stack: JavaScript crawler, MongoDB Atlas (Atlas Search सहित), Next.js front-end, AWS infra; लागत लगभग $2.2K/month।
  • कई लोगों को लगता है कि ~25M products के लिए यह overkill है और वे सस्ते, बेहतर-उपयुक्त विकल्प सुझाते हैं: Elasticsearch/OpenSearch, Typesense, Meilisearch, Postgres (full-text और vectors के साथ), या single bare-metal/Hetzner boxes तक।
  • कई लोग नोट करते हैं कि 25M documents आधुनिक search infra के लिए modest हैं और अच्छी architecture होने पर तेज़ तथा सस्ते होने चाहिए।

Search quality & features

  • यूज़र्स को “red shoes” जैसे generic queries के लिए results कमज़ोर या noisy लगते हैं; brand matches कभी-कभी स्पष्ट intent से ऊपर rank हो जाते हैं।
  • सुझाव: vector/semantic search, CLIP या similar के साथ, dense image captioning, color detection, और multimodal embeddings ताकि relevance बेहतर हो।
  • वांछित filters: price, “ships to”/“ships from” location, availability, NSFW filtering, delivery country, similarity search, और same product के लिए alternative offers दिखाना।

Data quality, curation & fraud

  • कई टिप्पणियाँ चेतावनी देती हैं कि low-quality, scammy, या dropshipped Shopify stores की लंबी tail मौजूद है।
  • पिछले projects में junk, scams, और sensitive/NSFW content हटाने के लिए भारी manual और automated curation की रिपोर्ट है; कई लोग curation को differentiation के लिए critical मानते हैं।

Monetization, competition & viability

  • मौजूदा model merchant fees हैं, “verified” और boosted listings के लिए; अभी affiliate revenue नहीं है।
  • कई लोग Shopify के अपने Shop app और विभिन्न price comparison engines को direct या indirect competition के रूप में देखते हैं।
  • पहले के समान projects का साझा अनुभव है कि technical execution manageable थी; user acquisition और monetization असली bottlenecks थे।

UX & miscellaneous

  • Feedback में slow responses, loading indicators की कमी, infinite scroll issues, navigation quirks, Unicode query errors, और आसान “open in new tab” की इच्छा शामिल है।
  • कुछ लोग Shopify की ToS implications पर सवाल उठाते हैं; अन्य इस चिंता को कम महत्व देते हैं या कहते हैं कि यह केवल legal action होने पर मायने रखती है।