Brave Leo अब डिफ़ॉल्ट रूप से Mixtral 8x7B का उपयोग करता है

Brave ने अपने built‑in AI assistant Leo को Mixtral 8x7B model पर स्विच कर दिया है, जिससे GPT‑4 से तुलना और llama.cpp, koboldcpp, और ollama जैसे tools के साथ consumer CPUs, GPUs, और Apple Silicon पर Mixtral को स्थानीय रूप से चलाने पर विस्तृत चर्चा शुरू हुई। Commenters quantization levels, memory requirements, और token speed के trade‑offs पर बहस करते हैं, और Mixtral serving करने वाले cloud providers (जैसे Mistral’s own API, Together, Groq, OpenRouter, Anyscale) की भी सूची बनाते हैं। Model choice के साथ-साथ, Brave की privacy claims, Chrome के Manifest V3 changes के तहत उसका adblocking approach, और unlinkable subscription tokens तथा omnibar-based queries जैसी विशेषताएँ trust और long-term viability को लेकर प्रशंसा और skepticism दोनों खींचती हैं।

Mixtral को स्थानीय रूप से चलाना

  • उपयोगकर्ताओं ने llama.cpp, koboldcpp, text-generation-webui, Oobabooga, LM Studio, Ollama, और Apple Silicon–optimized builds के जरिए सफल स्थानीय रन की रिपोर्ट दी है।
  • मेमोरी की ज़रूरतें बहुत अधिक हैं: 2-bit quantization के लिए भी लगभग 20GB RAM चाहिए; 4-bit मुश्किल से 32GB में फिट होता है; 6–8 bit के लिए आम तौर पर 64GB+ की आवश्यकता होती है।
  • GPU पर layers offload करना (--n-gpu-layers जैसे flags के जरिए) VRAM लगभग भरने तक बड़े speedups देता है; उसके बाद offloading, केवल CPU वाले mode से भी धीमा हो सकता है।
  • बड़े unified RAM वाले Apple Silicon (जैसे 36–64GB) को बार-बार “surprisingly fast” और सुविधाजनक बताया गया है।
  • AMD/ROCm और integrated GPUs काम कर सकते हैं, लेकिन setup अधिक जटिल है; कुछ लोगों के अनुसार integrated graphics पर performance “dead slow” है।
  • Jetson boards को लेकर बहस है: कुछ कहते हैं कि वे मज़ेदार और सक्षम हैं; अन्य लोग software stack को fragile और सामान्य LLM box के रूप में अनुपयुक्त बताते हैं।

Quantization & Precision

  • भारी quantization (2-bit) को गंभीर उपयोग के लिए व्यापक रूप से “terrible” कहा गया है; 4-bit+ को बेहतर tradeoff माना जाता है।
  • कई व्याख्याएँ दी गईं: neural nets noise-tolerant होते हैं; 16/32-bit float precision का बहुत सा हिस्सा redundant होता है; आधुनिक quantization block-wise lookup tables और अतिरिक्त scale metadata का उपयोग करती है।
  • Distillation और dropped weights को वैकल्पिक compression techniques के रूप में उल्लेखित किया गया है।

Remote Mixtral APIs and Performance

  • कई providers का नाम लिया गया है: OpenRouter, Together, Fireworks, Anyscale, Mistral’s own API, Replicate, और Groq।
  • Together और Groq को speed के लिए सराहा गया है; Groq Mixtral के लिए अत्यंत उच्च tokens/s का दावा करता है।
  • कुछ लोग production के लिए Mistral या Anyscale का उपयोग करते हैं और experimentation के लिए छोटे local quantized models का।

Brave, Manifest V3, and Adblocking

  • उपयोगकर्ताओं को Brave का built-in adblocker और Chromium performance पसंद है, और कुछ को लगता है कि ऊपर से uBlock Origin बहुत कम अतिरिक्त value देता है।
  • Manifest V3 को लेकर बहस:
    • एक पक्ष कहता है कि MV3 अभी भी बड़े rule limits और dynamic rule updates के साथ शक्तिशाली adblocking की अनुमति देता है।
    • दूसरा पक्ष तर्क देता है कि MV3 असली “dynamic filtering” (code-based request inspection/modification) को हटा देता है और adblock innovation को नए Chrome APIs पर निर्भर होने के लिए मजबूर करता है।
  • चिंता यह है कि Chromium की दिशा और Chrome Web Store की नीतियाँ extension-based blockers को सीमित करेंगी, चाहे Brave की मंशा कुछ भी हो।

Privacy, Logging, and Subscriptions

  • Leo के “no chat logs” और unlinkable subscription tokens की प्रशंसा की गई, लेकिन उन पर सवाल भी उठे, क्योंकि ये दावे अंततः trust-based हैं।
  • कुछ लोग GDPR और Brave के token scheme को सामान्य उपयोगकर्ताओं के लिए “good enough” मानते हैं; अन्य लोग Brave पर बहुत अधिक भरोसा न करने की चेतावनी देते हैं, critical articles और “no logs” वादों के प्रति सामान्य skepticism का हवाला देते हुए।
  • एक commenter ने बताया कि unlinkable tokens कैसे काम कर सकते हैं (random IDs, shuffled storage, limited entitlements), और zero-knowledge approaches को एक अधिक जटिल विकल्प के रूप में नोट किया।

Model Quality & UX

  • कई लोगों का कहना है कि GPT‑4 का उपयोग करने के बाद Mixtral स्पष्ट रूप से कमजोर लगता है, हालांकि यह अभी भी कई open models की तुलना में मजबूत है। अन्य लोगों ने अपने उपयोग में Mixtral को LLaMA 70B से बेहतर बताया।
  • उपयोग के मामले local coding assistants (जैसे Dolphin Mixtral), offline document/code analysis, और “quick syntax/parameter” प्रश्न हैं जहाँ latency महत्वपूर्ण होती है।
  • Leo को browser omnibar से invoke किया जा सकता है; Leo में PDF summarization स्पष्ट नहीं है/उपस्थित नहीं है, और विकल्प के रूप में Kagi’s extension सुझाया गया है।