Show HN: एक Mac पर 4.3 GB RAM में 80B Qwen, और iPhone पर 35B चलाएँ
उपभोक्ता उपकरणों पर विशाल language models चलाना आज अव्यावहारिक लग सकता है, लेकिन कई लोग Swiftlet जैसे प्रयोगों को—जो एक Mac पर SSD से 80B-parameter Qwen model और iPhone पर 35B model stream करता है—उस भविष्य की ओर महत्वपूर्ण कदम मानते हैं। टिप्पणीकार प्रदर्शन बाधाओं (विशेषकर memory bandwidth और prefill), SSD wear, और भौतिक सीमाओं पर बहस करते हैं, जबकि अन्य मानते हैं कि hardware, quantization, और model architectures में लगातार सुधार अंततः शक्तिशाली local AI को व्यवहार्य और सामान्य बना देंगे। चर्चा centralized cloud inference और on-device models की भी तुलना करती है, जिसमें लागत, latency, privacy, और user control के trade-offs पर प्रकाश डाला गया है।
प्रदर्शन और व्यावहारिकता
- कई टिप्पणीकारों का कहना है कि decode token/sec कहानी का केवल एक हिस्सा है; असली बाधा prefill बन जाती है, इसलिए बड़े prompts में कई मिनट या उससे भी अधिक लग सकते हैं (जैसे, M5 पर 10k tokens के लिए लगभग 30 मिनट)।
- मौजूदा गति coding या interactive agents के लिए बहुत धीमी मानी जा रही है, लेकिन background या overnight batch jobs के लिए संभावित रूप से स्वीकार्य हो सकती है।
- कुछ लोगों का तर्क है कि desktop-class मशीन को घंटों चालू रखने से बेहतर या सस्ता हो सकता है कि थोड़ी देर के लिए GPU किराए पर ले लिया जाए।
स्टोरेज, SSD घिसावट, और मेमोरी बैंडविड्थ
- भारी streaming से SSD को “मार देने” की चिंताओं पर बहस होती है।
- निष्कर्ष: writes मुख्य समस्या हैं; read wear (read disturb) मौजूद है, लेकिन गैर-24/7 पूर्ण-ड्राइव workloads के लिए यह व्यावहारिक समस्या होने की संभावना कम है।
- अन्य लोग लंबे समय तक चलने वाले SSDs और वास्तविक दुनिया में कम विफलता की रिपोर्ट करते हैं।
- कई टिप्पणियाँ इस बात पर ज़ोर देती हैं कि स्थानीय LLMs के लिए raw FLOPs नहीं, बल्कि memory bandwidth मुख्य बाधा है, खासकर जब weights SSD पर हों।
इस काम का मूल्य और दीर्घकालिक दिशा
- बहुत से लोग ऐसे projects को foundational मानते हैं: कच्चे, अव्यावहारिक शुरुआती कदम जो आगे चलकर breakthroughs और “motivated amateurs” को संभव बनाते हैं।
- संशयवादी तर्क देते हैं कि यह “चाँद तक पहुँचने के लिए पेड़ पर चढ़ने” जैसा है और सस्ते SSDs पर 1T-parameter models तक वास्तविक रूप से नहीं पहुँच सकता।
- आशावादी लोग hardware में ऐतिहासिक सुधारों का हवाला देते हैं और उम्मीद करते हैं कि hardware और software दोनों सुधारते रहेंगे, हालांकि भौतिक और bandwidth सीमाएँ स्वीकार की जाती हैं।
केंद्रीकृत बनाम on-device inference
- एक पक्ष मानता है कि दक्षता, parallelization, और उपयोगकर्ता आदतों के कारण 99%+ उपयोग केंद्रीकृत ही रहेगा।
- दूसरे privacy, offline capability, और “काफी अच्छा” छोटे models को on-device और on-prem setups के मज़बूत चालक मानते हैं।
हार्डवेयर का भविष्य: GPUs, Apple, ASICs, FPGAs
- GPU FLOPs और memory bandwidth trends पर चर्चा steady लेकिन अत्यधिक तेज़ नहीं बढ़त का संकेत देती है; memory capacity, FLOPs से पीछे रहती है।
- Apple की unified memory और NPUs को co-designed on-device LLMs के लिए उपयुक्त बताया गया है; कुछ लोग LLM-optimized accelerators या यहाँ तक कि silicon में ही baked-in models की अटकलें लगाते हैं।
- मौजूदा “model-on-silicon” products का उल्लेख है और यह अनुमान भी कि private actors niche, latency-critical domains के लिए पहले से ऐसा करते होंगे।
Model architectures और RAM tuning
- MoE और sparsity को सीमित RAM में बड़े models फिट करने के लिए महत्वपूर्ण माना जाता है, लेकिन किन experts को memory में “hot” रखना है, यह चुनना आसान नहीं है।
- परियोजना एक tunable RAM cache उपलब्ध कराती है; वर्तमान bottleneck SSD नहीं बल्कि GPU dispatch है, इसलिए अभी extra RAM उम्मीद के मुताबिक कम मदद करती है, लेकिन kernels बेहतर होने पर इसका महत्व बढ़ सकता है।
सुरक्षा, दुरुपयोग, और web access
- कुछ लोगों को चिंता है कि शक्तिशाली local models का लोकतंत्रीकरण hacking और scams को आसान बनाएगा; अन्य का तर्क है कि उसी तकनीक के साथ defenses भी बेहतर होंगे।
- web-aware local agents के लिए, टिप्पणीकार search APIs या self-hosted meta-search को यथार्थवादी विकल्प बताते हैं; पूरे web snapshot को डाउनलोड करना अव्यावहारिक माना जाता है।
प्रोजेक्ट विवरण और attribution
- “built in collaboration with Claude Code” वाक्यांश का अर्थ स्पष्ट किया गया है कि लेखक ने AI coding assistant का बहुत अधिक उपयोग किया, न कि उस vendor की औपचारिक भागीदारी थी।
- इसी तरह के पहले “first time on a phone” claims streaming-weight setups के लिए पहले भी नोट किए गए हैं, इसलिए इस milestone की विशिष्टता कुछ हद तक अस्पष्ट मानी जा रही है।