Launch HN: Greptile (YC W24) - codebases पर RAG जो वास्तव में काम करता है
Greptile नाम का एक नया टूल पूरे codebases पर retrieval-augmented generation (RAG) लागू करता है, ताकि डेवलपर projects के बारे में natural-language सवाल पूछ सकें और context-aware जवाब पा सकें—चाहे वह किसी specific type का serialization हो या components का आपसी interaction। Commenters को code comprehension, IDE integration, और बड़े या multi-language repositories पर इसके संभावित उपयोग में दिलचस्पी है, लेकिन scale पर reliability, GitHub permissions, embeddings की privacy, issues/PRs जैसे metadata की कमी, और launch के दौरान outages व errors के कारण product की maturity को लेकर चिंताएँ हैं। कई लोग इसकी तुलना Cursor, Cody, और Bloop जैसे मौजूदा tools से करते हैं, और self-hosting, बेहतर local workflows, तथा अधिक public repos और documentation sources के support जैसी सुविधाएँ माँगते हैं।
उत्पाद और मुख्य दृष्टिकोण
- टूल “codebases पर RAG” प्रदान करता है: पूरे repos पर प्रश्नों के उत्तर देने के लिए ASTs (tree‑sitter के माध्यम से), embeddings, और LLMs का उपयोग करता है।
- फोकस code comprehension और internal-docs के replacement/augmentation पर है, न कि मुख्य रूप से code generation पर (हालाँकि उपयोगकर्ता इसे code gen के लिए भी इस्तेमाल करते हैं)।
- वर्तमान में केवल code index करता है; commit messages, PRs, issues, comments, और doc comments के बेहतर उपयोग को जोड़ने की योजना है।
उपयोगकर्ता अनुभव और उपयोग के मामले
- सकारात्मक रिपोर्टें: nuanced framework questions के उत्तर दिए, (जैसे Rails BigDecimal JSON encoding) जो उपयोगकर्ताओं ने मैन्युअली सीखा था उसके अनुरूप थे।
- कुछ लोग इसे जटिल projects के लिए LLM context window को बढ़ाने जैसा मानते हैं; बड़े Rails और multi-language repos पर इसका उपयोग करने में रुचि है।
- उपयोगकर्ता चाहते हैं कि यदि API source उपलब्ध हो तो यह API error debugging में मदद करे।
इंटीग्रेशन और प्लेटफ़ॉर्म
- एक VS Code extension है; JetBrains plugin roadmap पर है।
- Public demo: ~100 open‑source repos को बिना login query किया जा सकता है।
- Private repos के लिए GitHub app आवश्यक है; permissions और “act on your behalf” wording को लेकर कुछ भ्रम है।
विश्वसनीयता, प्रदर्शन और UX समस्याएँ
- कई रिपोर्टों में errors (“internal error while processing/locating sources”), failed या stuck processing (अक्सर 99% पर), और AWS/DB outages शामिल हैं, खासकर HN traffic के दौरान।
- popular-repo links, voting UI, branch/repo selection, और बचा हुआ branding (“Onboard”) में bugs नोट किए गए।
- progress indicator और repo-selection UI को भ्रामक या झंझट वाला माना गया।
गोपनीयता, सुरक्षा और self-hosting
- दावा है कि processing के बाद code store नहीं किया जाता; वर्तमान में generated docstrings के embeddings store किए जाते हैं, और चर्चा हुई कि embeddings जानकारी leak कर सकती हैं।
- कुछ उपयोगकर्ता स्पष्ट code storage को प्राथमिकता देंगे यदि उससे speed बेहतर होती है, और/या पूरी तरह local या self-hosted versions चाहेंगे।
- टीम self-hosting और on-prem को भविष्य में देखती है, लेकिन निकट अवधि में LLMs संभवतः self-hosted नहीं होंगे।
मूल्य निर्धारण, सीमाएँ और adoption friction
- free tier में repo size limits हैं; बड़े test datasets वाले उपयोगकर्ताओं को मूल्यांकन करने में कठिनाई होती है।
- सुझाव:
.greptileignore-style exclusions, data versioning tools, और अधिक flexible trial (जैसे एक बड़ा repo)। - GitHub से automatic email use को लेकर चिंताएँ; opt-in और अलग email choice के अनुरोध।
पोज़िशनिंग और तुलना
- Bloop, Adrenaline, Cursor, और Cody से तुलना की गई; इसे IDE replacement के बजाय full-codebase comprehension के रूप में प्रस्तुत किया गया।
- कई लोग बताते हैं कि “RAG” jargon समझाया नहीं गया है या confusing है और इसे बेहतर तरीके से बताया जाना चाहिए।