नो GPU वाले 13 साल पुराने Xeon पर Gemma 4 26B को 5 टोकन/सेकंड पर चलाना

10–13 साल पुराने Xeon CPUs पर लगभग 5 tokens per second की दर से 26B-parameter Gemma 4 model चलाना दिखाता है कि पर्याप्त RAM और सावधानीपूर्वक quantization होने पर बड़े आधुनिक LLMs aging hardware पर local रूप से चल सकते हैं। टिप्पणीकार इस बात पर बहस करते हैं कि यह वास्तव में कितना व्यावहारिक है, धीमी token speeds और ऊँची power draw की तुलना privacy, unlimited usage, और “अगर hardware पहले से आपके पास है तो मुफ़्त” compute के आकर्षण से करते हैं, और cloud inference providers के मुकाबले लागत की तुलना करते हैं। थ्रेड local machines पर ever-larger sparse/MoE models की दिशा पर भी चर्चा करता है, और AI-generated technical blog posts तथा disclosure से जुड़ी community norms पर चिंताएँ उठाता है.

AI-लिखित सामग्री और HN मानदंड

  • कई टिप्पणीकारों का तर्क है कि ब्लॉग पोस्ट और कुछ टिप्पणियाँ “AI आउटपुट जैसी” लगती हैं, और वे नोट करते हैं कि AI-लिखी पोस्ट/टिप्पणियाँ HN मानदंडों का उल्लंघन करती हैं।
  • अन्य लोग असहमत हैं, या कहते हैं कि जब लोग टेक्स्ट का मसौदा बनाने के लिए LLMs का भारी उपयोग करते हैं, तब अंतर करना कठिन होता है।
  • लेखक बताता है कि कोड पैच AI-सहायता प्राप्त था, लेकिन पोस्ट में स्पष्ट किया गया है कि कौन-से हिस्से मानव थे और कौन-से AI के।

बग और तकनीकी विवरण

  • मूल fork ने AVX2 मान लिया था; पुराने Ivy Bridge Xeons में यह नहीं होता, जिससे build failures हुए और, अधिक सूक्ष्म रूप से, दो MoE ops के लिए dispatch paths गायब रहे।
  • गैर‑AVX2 builds पर, MoE expert outputs uninitialized memory से आ रहे थे, जिससे प्रवाहपूर्ण लेकिन बेतुका टेक्स्ट बन रहा था।
  • इस समस्या का एक fix upstream एक pull request के रूप में जमा किया गया है।

प्रदर्शन, quantization और RAM

  • पुराने Xeons, dual-CPU servers, और Mac hardware पर Gemma 4 और अन्य models चलाने की कई रिपोर्टें हैं।
  • token rates काफी अलग-अलग हैं: 2013-era Xeons पर Gemma 4 26B के लिए लगभग 5 t/s; GPUs और छोटे/ज़्यादा सख्ती से quantized models पर अधिक rates।
  • Q4 बनाम Q8 पर चर्चा: Q4 bandwidth की ज़रूरतें आधी कर देता है और bandwidth-limited systems पर speed लगभग दोगुनी कर सकता है, लेकिन RAM उपलब्ध हो तो quality के कारण Q8/Q6 को प्राथमिकता दी जाती है।
  • बड़ा RAM (26B models द्वारा उपयोग किए गए 80–100+ GB) आम है; कुछ लोग बेहद कम-RAM setups और custom loaders के साथ प्रयोग करते हैं।

धीमे स्थानीय models की उपयोगिता

  • राय में स्पष्ट विभाजन है: कुछ लोगों के लिए 5–10 t/s background या batch workflows के लिए स्वीकार्य है; अन्य इसे interactive coding या लंबे reasoning chains के लिए अनुपयोगी मानते हैं।
  • “flow state” पर बहस: तेज models (सैकड़ों t/s) उपयोगकर्ताओं को जल्दी iterate करने देते हैं; धीमे models लोगों को queue-and-walk-away उपयोग की ओर धकेलते हैं।

लागत, power और efficiency

  • कई back-of-envelope गणनाएँ सुझाव देती हैं कि local CPU inference, खासकर 300–500W servers और ऊँची ऊर्जा कीमतों के साथ, cloud tokens से अधिक बिजली खर्च कर सकता है।
  • प्रतिवाद: सस्ती बिजली, solar, या waste heat का space heating के लिए उपयोग इस गणना को बदल सकता है।
  • GPU power-capping ऊर्जा उपयोग को काफी घटा सकता है, जबकि speed में केवल मामूली कमी आती है।
  • कुछ लोग नोट करते हैं कि cloud providers फिलहाल tokens को वास्तविक लागत से कम पर बेच सकते हैं, इसलिए कीमतें बढ़ सकती हैं।

Privacy, control और local के लिए प्रेरणा

  • कई लोग local inference के प्राथमिक कारणों के रूप में privacy, independence, और vendor limits से मुक्ति पर जोर देते हैं, न कि लागत पर।
  • अन्य लोग local hardware को experimentation के लिए मूल्यवान मानते हैं, लेकिन गुणवत्ता या speed में अभी top cloud models के साथ प्रतिस्पर्धी नहीं मानते।

Local LLMs का भविष्य

  • आशावादी अनुमान: ~2027–2028 तक consumer hardware पर >200B MoE और यहाँ तक कि ~1T-parameter-equivalent models, ternary/1-bit training, sparse MoE, नए GPUs, और specialized accelerators की मदद से।
  • संशयवादी RAM bandwidth, power constraints, fab capacity, और datacenters को प्राथमिकता देने वाली आर्थिक प्रेरणाओं को रेखांकित करते हैं।
  • कुछ का तर्क है कि transformers संरचनात्मक रूप से कुशल local inference के लिए उपयुक्त नहीं हैं; अन्य ongoing architectural और hardware work को आशाजनक मानते हैं।

Tooling और configuration issues

  • व्यावहारिक सुझाव: Ollama में timeouts समायोजित करना, LM Studio TTL/eviction settings खोजना, और धीमे local models का बेहतर उपयोग करने के लिए batch/agent frameworks का इस्तेमाल करना।