Show HN: ओपन-सोर्स इंजन जो किसी भी M-सीरीज़ Mac पर 2 GB RAM में Gemma 4 26B चलाता है

एक ओपन-सोर्स इंजन दिखाता है कि Google का Gemma 4 26B MoE मॉडल M‑सीरीज़ Macs पर SSD से “expert” वेट्स स्ट्रीम करके सिर्फ 2 GB RAM में चल सकता है, यानी कच्ची स्पीड के बदले बहुत कम मेमोरी उपयोग। टिप्पणीकार इस दृष्टिकोण की MLX, llama.cpp, और Colibri तथा DwarfStar जैसे प्रोजेक्ट्स से तुलना करते हैं, और बताते हैं कि SSD बैंडविड्थ, OS पेज कैश, और Apple की unified memory अब local inference के लिए GPU FLOPs जितने ही महत्वपूर्ण हो गए हैं। थ्रेड यह भी उठाता है कि क्या ऐसी तकनीकें बड़े MoE मॉडलों तक स्केल हो सकती हैं, क्या ये वास्तविक coding काम के लिए व्यावहारिक हैं, और ये भविष्य के consumer hardware तथा on-device AI के लिए क्या अर्थ रखती हैं।

अवलोकन और लक्ष्य

  • इंजन SSD से विशेषज्ञों को स्ट्रीम करके, पूरी 14 GB वेट्स लोड करने के बजाय, M‑सीरीज़ Macs पर लगभग 2 GB RAM का उपयोग करते हुए Gemma 4 26B MoE को स्थानीय रूप से चलाता है।
  • लक्ष्य: Apple लैपटॉप/डेस्कटॉप पर कम-RAM, रोज़मर्रा के कामों का उपयोग; फ़ुटप्रिंट और ऑफ़लाइन प्राइवेसी के बदले स्पीड का ट्रेड-ऑफ़।

प्रदर्शन और हार्डवेयर-निर्भरता

  • रिपोर्ट की गई गति:
    • 8 GB RAM वाले M1/M2 Air/Neo पर ~4–6 tok/s।
    • बेस-SSD M4 mini पर ~5 tok/s; M1 Max Studio पर ~12 tok/s।
    • M5 MacBook Pro पर ~31–35 tok/s; 64 GB M4 Max पर ~48 tok/s।
  • बड़े अंतर का कारण बताया गया:
    • SSD स्पीड (M5/M4 Max SSDs ~2 GB/s की तुलना में 3–7 GB/s हो सकती हैं)।
    • मेमोरी बैंडविड्थ और सिस्टम-लेवल कैश।
    • OS पेज कैश: अधिक RAM से ज़्यादातर expert weights कैश में बने रह सकते हैं, जिससे वास्तविक डिस्क रीड्स बहुत घट जाती हैं।
  • भारी मेमोरी प्रेशर के तहत स्पीड गिरती है, लेकिन पूरी तरह ध्वस्त होने के बजाय धीरे-धीरे घटती है।

तकनीकी दृष्टिकोण (MoE + SSD स्ट्रीमिंग)

  • MoE sparsity का उपयोग करता है: प्रति token केवल विशेषज्ञों का एक छोटा उपसमुच्चय सक्रिय होता है।
  • एक स्पष्ट expert cache लागू करता है (~16 slots डिफ़ॉल्ट; अधिक slots से RAM बढ़ती है लेकिन स्पीड सुधरती है)।
    • Cache hit rates लगभग 60–70%; 1–2 tokens तक आंशिक पुन: उपयोग।
  • महत्वपूर्ण बदलाव: experts के लिए mmap से parallel pread पर जाना:
    • बेंचमार्क ~3.36 MB expert के लिए लगभग 10 ms बनाम ~2.8–3 ms दिखाते हैं, और 8 GB M2 पर ~0.5 → ~4 tok/s।
  • जहाँ संभव हो, latency छिपाने के लिए SSD reads को GPU compute के साथ overlap करता है।
  • M2 पर प्रति token SSD से 250–320 MB पढ़ता है (I/O phase के दौरान ~3 GB/s)।

अन्य इंजनों/मॉडलों से तुलना

  • M5 पर पूर्ण in-RAM Gemma 4 के साथ MLX: ~75 tok/s लेकिन ~14 GB RAM उपयोग।
  • यही इंजन: समान श्रेणी की मशीन पर ~2 GB RAM का उपयोग करते हुए ~31–35 tok/s।
  • चर्चा में कहा गया कि mmap-आधारित offload वाला llama.cpp 2 GB में फिट हो सकता है, लेकिन धीमा होगा।
  • अन्य SSD-स्ट्रीमिंग MoE इंजन (Colibri, Flash-MoE, DwarfStar, MoEspresso) का भी ज़िक्र हुआ, जो सामान्यतः बड़े मॉडल और अधिक RAM वाले उच्च-स्तरीय Macs को लक्षित करते हैं।

प्लेटफ़ॉर्म दायरा और सीमाएँ

  • केवल Mac: Metal और unified memory पर निर्भर; Windows/Linux या discrete GPUs पर port करने के लिए redesign (CUDA/Vulkan) चाहिए।
  • फिलहाल Gemma 4 MoE पर केंद्रित; Qwen 3.6 MoE काम कर सकता है, लेकिन architecture अधिक जटिल है।
  • इस implementation में dense models या diffusion models के लिए उपयुक्त नहीं।
  • बहुत बड़े MoEs (जैसे Kimi K3) सिद्धांततः समान विचारों से चल सकते हैं, लेकिन 16–64 GB machines पर प्रति-token अत्यधिक I/O के कारण व्यावहारिक रूप से अनुपयोगी होंगे।

उपयोगिता, संदेह और UX

  • उत्साह: कई लोगों के लिए यह consumer Macs पर local inference की दिशा में बड़ा कदम है; “26B in 2 GB” जैसा engineering कारनामा प्रभावशाली है; offline, privacy-preserving उपयोग के लिए आकर्षक।
  • संदेह:
    • कुछ लोगों का तर्क है कि गंभीर coding या interactive काम के लिए 5–30 tok/s अभी भी cloud models की तुलना में बहुत धीमा है।
    • अन्य लोग नोट करते हैं कि उच्च-गुणवत्ता वाले local coding assistants के लिए अब भी बड़े GPUs या frontier-class models चाहिए।
  • Gemma को general tasks और multilingual basics के लिए मजबूत, लेकिन coding में Qwen से कमजोर माना जाता है; फिर भी कुछ production use के लिए “काफ़ी अच्छा”।

भविष्य की दिशा और शोध विचार

  • उठाए गए विचार:
    • अधिक RAM उपलब्ध होने पर बड़े expert caches।
    • SSDs और RAM बढ़ने के साथ बड़े MoE models पर उसी streaming दृष्टिकोण का उपयोग।
    • MTP-जैसे heads का उपयोग करके speculative expert prefetching; विरोध में कहा गया कि यह कठिन है क्योंकि expert routing प्रति-layer होती है और पिछली layers के outputs पर निर्भर करती है।
  • Apple के नए foundation models को prompt-level expert loading का उपयोग करने वाला, संबंधित लेकिन अलग दृष्टिकोण बताया गया।

मेटा: सुरक्षा और “LLM-ese”

  • एक टिप्पणीकार ने repo का त्वरित security review करने के लिए एक LLM का उपयोग किया; अन्य लोग “AI says it’s safe” दावों के मूल्य और जोखिम पर बहस करते हैं।
  • README में LLM-परिष्कृत लेखन शैली पर लंबा उप-थ्रेड:
    • कुछ लोगों को पहचानने योग्य “LLM-ese” वाक्यांश पसंद नहीं आते; अन्य गैर-मूल-भाषी लेखकों का भाषा सुधारने के लिए tools उपयोग करना बचाव करते हैं।
    • कई प्रतिभागियों की सहमति: code और experiments, perfect prose से ज़्यादा महत्वपूर्ण हैं।