Mistral "Mixtral" 8x7B 32k मॉडल [magnet]
Mistral ने चुपचाप “Mixtral” 8x7B जारी किया है, जो 32k-context वाला Mixture-of-Experts language model है और BitTorrent magnet link के ज़रिए वितरित किया गया, जिससे GPT-4 और Gemini जैसी proprietary प्रणालियों के लिए एक बड़े open-weights विकल्प को लेकर उत्साह पैदा हुआ। टिप्पणीकर्ता इसकी architecture और config का विश्लेषण करते हैं, यह नोट करते हुए कि inference time पर यह लगभग ~12–13B model की तरह व्यवहार करता है जबकि ~70B-class performance का दावा करता है, और इस पर बहस करते हैं कि aggressive quantization के साथ इसे consumer GPUs, CPUs, और नए Mac hardware पर चलाना कितना संभव है। इस रिलीज़ को एक समझदार, developer-friendly marketing move भी माना जा रहा है, जो polished लेकिन closed corporate launches के बिल्कुल विपरीत है, और एक संभावित मोड़ के रूप में देखा जा रहा है जहाँ locally runnable open models state-of-the-art commercial LLM capabilities के करीब पहुँचने लगते हैं।
रिलीज़ और वितरण
- मॉडल “Mixtral 8x7B 32k” एक BitTorrent magnet link के ज़रिए बहुत कम व्याख्या के साथ जारी किया गया, और बाद में समुदाय के सदस्यों ने इसे Hugging Face पर मिरर कर दिया।
- बहुत से लोगों ने इस warez-शैली की ASCII-art रिलीज़ को जानबूझकर किया गया, high-signal marketing माना, खासकर जब इसकी तुलना पॉलिश्ड कॉर्पोरेट AI लॉन्च और डेमो से की गई।
- कुछ उपयोगकर्ताओं को magnet के साथ दिक्कतें आईं और उन्होंने tracker lists साझा कीं; दूसरों ने जल्दी ही inference endpoints और experimental HF repos खड़े कर दिए।
आर्किटेक्चर और क्षमताएँ
- Mixtral एक Mixture-of-Experts (MoE) मॉडल है, जिसमें प्रत्येक लगभग 7B parameters वाले 8 experts हैं, और प्रति token top‑2 experts चुने जाते हैं।
- कॉन्फ़िग: 32 layers, dim 4096, hidden_dim 14336 (≈3.5× MLP expansion), 32 heads के साथ 8 KV heads (multi-query style), vocab 32k, दावा किया गया 32k context (लेकिन पहले Mistral ने sliding windows इस्तेमाल किए और व्यवहार में 8k जैसा लगा)।
- Attention (
2B params) साझा है; FFN “experts” (5B each) हर expert के अनुसार बदलते हैं।
हार्डवेयर आवश्यकताएँ और runtime व्यवहार
- Raw weights ~86–96 GB; 4‑bit quantization में लोगों को उम्मीद है कि यह ~24 GB VRAM में फिट हो जाएगा, जो बड़े 30–40B dense models के समान है।
- क्योंकि प्रति token केवल 2 experts सक्रिय होते हैं, effective compute लगभग 12–13B dense model प्रति token के बराबर है, हालांकि अच्छी speed के लिए सभी experts को fast memory में resident रहना चाहिए।
- इस पर बहस है कि क्या CPU और GPU या tmpfs के बीच experts की smart swapping / caching व्यावहारिक है; कुछ कहते हैं कि यह PCIe-limited होगा, जबकि दूसरे आशावादी हैं।
- उपयोगकर्ता उम्मीद करते हैं कि यह high-RAM Macs (128–192 GB तक) और quantization के साथ single 24 GB GPUs पर चलेगा; 4 GB VRAM सेटअप के experimental दावे भी सामने आते हैं।
MoE routing चर्चा
- कई व्याख्याएँ स्पष्ट करती हैं कि एक छोटा “router” नेटवर्क प्रति token 2 experts चुनता है, और यह चुनाव हर token पर बदल सकता है।
- इससे यह सरल आशा कमजोर पड़ती है कि केवल experts का एक उपसमूह लोड किया जा सकता है; interactive performance के लिए संभवतः सभी experts को RAM/VRAM में रखना पड़ेगा।
तुलनाएँ, benchmarks और fine-tuning
- बहुत से लोग उम्मीद करते हैं कि Mixtral 8x7B dense 40B–70B open models के बराबर या उनसे आगे निकल जाएगा; कुछ का दावा है कि यह Llama‑2 70B से ऊपर benchmark करता है, लेकिन दूसरे benchmark overfitting के बारे में चेतावनी देते हैं।
- Mistral/Yi पर नए “neural alignment” fine-tunes की चर्चा होती है, जो Hugging Face leaderboards में शीर्ष पर पहुँचते हैं; प्रतिभागी इस पर बहस करते हैं कि ऐसे leaderboards कितने अर्थपूर्ण हैं।
- कई टिप्पणियाँ Mistral 7B (और उसके finetunes) की कई कामों के लिए लगभग GPT‑3.5‑स्तर के रूप में प्रशंसा करती हैं, और Mixtral को open-weights models के लिए एक बड़ा कदम मानती हैं।
व्यवसाय मॉडल और रणनीति
- कुछ लोग अनुमान लगाते हैं कि Mistral की रणनीति मजबूत open-weight releases के माध्यम से प्रतिष्ठा बनाना, फिर hosting, fine-tuning, और support से कमाई करना है।
- अन्य लोग इस open approach की तुलना बड़े US companies के geoblocked या closed models और Google के Gemini जैसे non-released weights से करते हैं।