Launch HN: Greptile (YC W24) - codebases पर RAG जो वास्तव में काम करता है

Greptile नाम का एक नया टूल पूरे codebases पर retrieval-augmented generation (RAG) लागू करता है, ताकि डेवलपर projects के बारे में natural-language सवाल पूछ सकें और context-aware जवाब पा सकें—चाहे वह किसी specific type का serialization हो या components का आपसी interaction। Commenters को code comprehension, IDE integration, और बड़े या multi-language repositories पर इसके संभावित उपयोग में दिलचस्पी है, लेकिन scale पर reliability, GitHub permissions, embeddings की privacy, issues/PRs जैसे metadata की कमी, और launch के दौरान outages व errors के कारण product की maturity को लेकर चिंताएँ हैं। कई लोग इसकी तुलना Cursor, Cody, और Bloop जैसे मौजूदा tools से करते हैं, और self-hosting, बेहतर local workflows, तथा अधिक public repos और documentation sources के support जैसी सुविधाएँ माँगते हैं।

उत्पाद और मुख्य दृष्टिकोण

  • टूल “codebases पर RAG” प्रदान करता है: पूरे repos पर प्रश्नों के उत्तर देने के लिए ASTs (tree‑sitter के माध्यम से), embeddings, और LLMs का उपयोग करता है।
  • फोकस code comprehension और internal-docs के replacement/augmentation पर है, न कि मुख्य रूप से code generation पर (हालाँकि उपयोगकर्ता इसे code gen के लिए भी इस्तेमाल करते हैं)।
  • वर्तमान में केवल code index करता है; commit messages, PRs, issues, comments, और doc comments के बेहतर उपयोग को जोड़ने की योजना है।

उपयोगकर्ता अनुभव और उपयोग के मामले

  • सकारात्मक रिपोर्टें: nuanced framework questions के उत्तर दिए, (जैसे Rails BigDecimal JSON encoding) जो उपयोगकर्ताओं ने मैन्युअली सीखा था उसके अनुरूप थे।
  • कुछ लोग इसे जटिल projects के लिए LLM context window को बढ़ाने जैसा मानते हैं; बड़े Rails और multi-language repos पर इसका उपयोग करने में रुचि है।
  • उपयोगकर्ता चाहते हैं कि यदि API source उपलब्ध हो तो यह API error debugging में मदद करे।

इंटीग्रेशन और प्लेटफ़ॉर्म

  • एक VS Code extension है; JetBrains plugin roadmap पर है।
  • Public demo: ~100 open‑source repos को बिना login query किया जा सकता है।
  • Private repos के लिए GitHub app आवश्यक है; permissions और “act on your behalf” wording को लेकर कुछ भ्रम है।

विश्वसनीयता, प्रदर्शन और UX समस्याएँ

  • कई रिपोर्टों में errors (“internal error while processing/locating sources”), failed या stuck processing (अक्सर 99% पर), और AWS/DB outages शामिल हैं, खासकर HN traffic के दौरान।
  • popular-repo links, voting UI, branch/repo selection, और बचा हुआ branding (“Onboard”) में bugs नोट किए गए।
  • progress indicator और repo-selection UI को भ्रामक या झंझट वाला माना गया।

गोपनीयता, सुरक्षा और self-hosting

  • दावा है कि processing के बाद code store नहीं किया जाता; वर्तमान में generated docstrings के embeddings store किए जाते हैं, और चर्चा हुई कि embeddings जानकारी leak कर सकती हैं।
  • कुछ उपयोगकर्ता स्पष्ट code storage को प्राथमिकता देंगे यदि उससे speed बेहतर होती है, और/या पूरी तरह local या self-hosted versions चाहेंगे।
  • टीम self-hosting और on-prem को भविष्य में देखती है, लेकिन निकट अवधि में LLMs संभवतः self-hosted नहीं होंगे।

मूल्य निर्धारण, सीमाएँ और adoption friction

  • free tier में repo size limits हैं; बड़े test datasets वाले उपयोगकर्ताओं को मूल्यांकन करने में कठिनाई होती है।
  • सुझाव: .greptileignore-style exclusions, data versioning tools, और अधिक flexible trial (जैसे एक बड़ा repo)।
  • GitHub से automatic email use को लेकर चिंताएँ; opt-in और अलग email choice के अनुरोध।

पोज़िशनिंग और तुलना

  • Bloop, Adrenaline, Cursor, और Cody से तुलना की गई; इसे IDE replacement के बजाय full-codebase comprehension के रूप में प्रस्तुत किया गया।
  • कई लोग बताते हैं कि “RAG” jargon समझाया नहीं गया है या confusing है और इसे बेहतर तरीके से बताया जाना चाहिए।