Gemma: नए ओपन मॉडल
Google के Gemma 2B और 7B “open” language models का release उनके मज़बूत benchmarks, local-run support (llama.cpp, Ollama, gemma.cpp), और permissive commercial use के कारण स्वागतयोग्य माना गया है, जिससे वे Llama 2, Mistral और Phi-2 के प्रतिस्पर्धी बनते हैं। Commenters technical design (बड़ा 256k tokenizer, architecture choices, quantization behavior, 8k context) को परखते हैं और ध्यान दिलाते हैं कि base और instruction-tuned weights उपलब्ध हैं, लेकिन training data और code नहीं, जिससे यह सवाल उठता है कि ये models वास्तव में कितने “open” हैं। बहस का बड़ा हिस्सा Google के custom license और safety/“alignment” constraints पर केंद्रित है; कुछ इन्हें उचित risk management मानते हैं, जबकि अन्य इन्हें restrictive, politically biased, या गंभीर commercial reliance के लिए अनुपयुक्त मानते हैं.
मॉडल प्रदर्शन और आर्किटेक्चर
- कई लोग Gemma 7B के बेंचमार्क्स को लगभग Mistral 7B के बराबर मानते हैं; 2B को कमज़ोर माना जाता है और कई सार्वजनिक बेंचमार्क्स पर Phi-2 से पीछे बताया जाता है।
- आर्किटेक्चर की बारीकियाँ रुचि जगाती हैं: 256k‑टोकन vocab, बड़ा FFN expansion, MQA/GQA विकल्प, और tokenizer डिज़ाइन जो Llama के काफ़ी क़रीब है लेकिन बड़ा है और उसमें कई special tokens हैं।
- कुछ का तर्क है कि Gemma के 6T training tokens और सिर्फ़ मामूली gains को देखते हुए 7B मॉडल शायद काफ़ी हद तक near-saturated हो चुके हैं।
उपलब्धता और टूलिंग
- weights डाउनलोड किए जा सकते हैं (Kaggle, Hugging Face), और आधिकारिक JAX, Keras, PyTorch, तथा एक standalone C++ engine उपलब्ध हैं।
- GGUF और llama.cpp support मौजूद है; Gemma Ollama और अन्य local UIs में दिखाई देता है।
- context length 8k tokens है। extended-context या multimodal versions के बारे में सवाल का जवाब केवल “stay tuned” से दिया गया है।
लाइसेंसिंग, “open” की परिभाषा, और commercial use
- weights “open” हैं लेकिन custom terms के तहत, OSI license के तहत नहीं। training code या datasets जारी नहीं किए गए हैं।
- बहस इस बात पर केंद्रित है कि इसे “open” कहा जाए या “weights-available,” और Meta तथा Mistral के licenses से तुलना की जाती है।
- terms में एक “reasonable efforts to update” clause और एक व्यापक prohibited-use policy शामिल है; कुछ लोग इसे de facto kill switch मानते हैं और commercial use के लिए Gemma से बचते हैं, तथा Apache/MIT models को पसंद करते हैं।
- अन्य लोग नोट करते हैं कि व्यवहार में कई startups restrictive licenses की अनदेखी कर देते हैं।
सुरक्षा, alignment, और bias
- base (pretrained) और aligned (instruction-tuned) checkpoints दोनों जारी किए गए हैं; users alignment बदलने के लिए fine-tune कर सकते हैं।
- कुछ लोग ideological/safety tuning का स्पष्ट characterization चाहते हैं; अन्य का तर्क है कि इसे परिभाषित या test करना कठिन है।
- Gemini images और history के अलग लेकिन संबंधित उदाहरण (जैसे racially “diversified” outputs) इस संदेह को बढ़ाते हैं कि Google के models राजनीतिक रूप से biased हो सकते हैं या “falsifying history” कर सकते हैं।
Quantization और local inference behavior
- शुरुआती 4‑bit Gemma 7B quantizations (जैसे Ollama में) ने बेतुका text दिया; higher-precision या अलग stacks (Transformers 4‑bit, gemma.cpp’s NUQ 4.5‑bit) बेहतर काम करते हैं लेकिन धीमे हैं।
- कुछ लोग बताते हैं कि Gemma, Llama/Mistral से धीमा है और finetuning consumer GPUs पर व्यावहारिक नहीं हो सकता।
Community प्रतिक्रियाएँ और रणनीति
- बहुत से लोग इस release और HN पर टीम की सीधी भागीदारी की सराहना करते हैं।
- अन्य लोग इसे Google के ecosystem को बढ़ावा देने और closed-model moats को कमजोर करने के लिए एक PR चाल मानते हैं, जबकि key assets (data, training stack) को proprietary बनाए रखते हैं।