Nvidia का Chat with RTX एक AI चैटबॉट है जो आपके PC पर लोकल रूप से चलता है

Nvidia का नया “Chat with RTX” tech demo एक local AI chatbot पेश करता है जो Windows PCs पर हालिया RTX 30/40-series GPUs के साथ Mistral या Llama 2 चलाता है, और RAG के जरिए users के documents तथा web content को index करके उन्हें अपने डेटा पर query करने देता है। टिप्पणीकार इसे Nvidia के TensorRT-LLM acceleration के प्रदर्शन के साथ-साथ AI workloads को नए hardware तक सीमित करने की कोशिश के रूप में देखते हैं, जिससे कृत्रिम GPU और VRAM requirements पर शिकायतें और मौजूदा open-source tools से तुलना शुरू हो गई है, जिन्हें non-experts के लिए सेट up करना कठिन है। privacy, censorship, और क्या brand-backed, one-click installers local LLMs को मौजूदा DIY solutions से कहीं व्यापक audience तक पहुँचाएँगे, इस पर भी बहस है.

हार्डवेयर आवश्यकताएँ और सीमाएँ

  • आधिकारिक आवश्यकताएँ: Windows 11, 16GB RAM, RTX 30/40 सीरीज़ या ≥8GB VRAM वाला RTX Ampere/Ada GPU, हालिया ड्राइवर।
  • कई लोगों की शिकायत है कि 20-सीरीज़ RTX (जैसे 11GB वाला 2080 Ti) को बाहर रखा गया है, और वे इसे एक कृत्रिम, ब्रांडिंग-चालित सीमा मानते हैं।
  • कुछ का तर्क है कि यह लोअर-प्रिसीजन फ़ॉर्मैट्स (जैसे bf16) के खराब/अनुपस्थित समर्थन और पहली पीढ़ी के tensor cores के कारण है; अन्य लोग बताते हैं कि TensorRT-LLM स्वयं Turing को समर्थित बताता है, इसलिए यह प्रतिबंध मनमाना लगता है।
  • 8GB VRAM की न्यूनतम शर्त नए 6GB RTX 3050 जैसे कार्डों को भी बाहर कर देती है, जिसे उपयोगकर्ता निराशाजनक मानते हैं।

मॉडल, प्रदर्शन और टेक स्टैक

  • इंस्टॉलर लगभग 35GB का है और इसमें int4 quantization में LLaMA 13B तथा Mistral/Ministral 7B शामिल हैं; 8GB कार्डों पर यह डिफ़ॉल्ट रूप से Mistral 7B का उपयोग करता दिखता है।
  • बैकएंड TensorRT-LLM और एक Windows RAG wrapper है; UI एक पतला Gradio-आधारित front end है, जिसमें bundled Conda environment शामिल है।
  • रिपोर्ट किया गया प्रदर्शन बहुत तेज़ है (जैसे, “मैं जितना पढ़ सकता हूँ उससे तेज़,” हाई-एंड कार्डों पर सैकड़ों tokens/s), लेकिन इसके बदले variability कम और conversational context सीमित है।
  • कई टिप्पणीकार नोट करते हैं कि TensorRT-LLM, llama.cpp जैसे विकल्पों की तुलना में तेज़ inference engines में से एक है, हालांकि इसे हाथ से सेट करना अधिक कठिन है।

उद्देश्य, दर्शक और मौजूदा टूल्स की तुलना में मूल्य

  • कुछ लोगों को text-generation-webui, Ollama (non-Windows पर), LM Studio आदि जैसे टूल्स की तुलना में इसका उद्देश्य समझने में कठिनाई होती है।
  • दूसरे लोग तर्क देते हैं कि इसका मूल्य यह है:
    • आधिकारिक Nvidia branding और support।
    • non-expert Windows उपयोगकर्ताओं के लिए one-click installer और सरल UI।
    • VRAM के आधार पर automatic model selection।
  • तुलना: open-source stacks को अधिक flexible माना जाता है, लेकिन वे डराने वाले भी हैं (GitHub, terminal scripts, jargon-heavy UIs)।

RAG और “Chat with Your Files”

  • प्रमुख विशेषता के रूप में built-in RAG over local data (documents, YouTube URLs) को रेखांकित किया गया है।
  • कुछ लोगों का कहना है कि RAG की quality मिश्रित है: उत्तर सही होते हैं, लेकिन कभी-कभी file citations गलत होती हैं।
  • लोग अपनी सभी गतिविधियों और documents को index करने वाले local personal assistant की प्रबल अपील देखते हैं, लेकिन मानते हैं कि यह अभी पूरी तरह साकार नहीं हुआ है।

Local बनाम Cloud, Privacy और Censorship

  • उपयोगकर्ताओं को पसंद है कि यह local है और cloud AIs की तुलना में संभावित रूप से कम censored है, लेकिन चिंता है कि Nvidia फिर भी data collect कर सकता है।
  • source code (installer को छोड़कर) inspection के लिए उपलब्ध है; कुछ लोग चिंता होने पर network traffic monitoring/blocking की सलाह देते हैं।
  • legal/PR risk को वह कारण बताया गया है कि Nvidia फिर भी content guardrails शामिल करेगा।

मार्केट और इकोसिस्टम

  • इसे TensorRT-LLM के लिए एक tech demo और Nvidia के लिए RTX को केवल ray tracing नहीं, बल्कि एक “AI” brand के रूप में आगे बढ़ाने का तरीका माना जा रहा है।
  • कुछ लोग Linux version की कमी पर अफसोस जताते हैं; अन्य लोग Linux उपयोगकर्ताओं के लिए underlying TensorRT-LLM repo की ओर इशारा करते हैं।