Mistral CEO ने 'लीक' हुए नए ओपन सोर्स AI मॉडल के GPT4 के करीब प्रदर्शन की पुष्टि की

Mistral AI से जुड़ा एक लीक हुआ “miqu-1-70b” large language model ध्यान आकर्षित कर रहा है, क्योंकि बताया जा रहा है कि यह GPT‑4-स्तरीय प्रदर्शन के करीब पहुँचता है, जबकि इसे quantized रूप में स्थानीय उपयोग के लिए उपयुक्त तरीके से वितरित किया गया है। टिप्पणीकार इस पर बहस कर रहे हैं कि क्या यह लीक एक जानबूझकर PR चाल है, वास्तविक दुनिया के कार्यों में यह GPT‑4 से कितना मेल खाता है, और जब केवल weights—not training data—जारी किए जाते हैं तो AI models के लिए “open source” का अर्थ क्या होना चाहिए। यह घटना cost, guardrails, performance stability, और proprietary तथा open-weight models के बीच प्रगति की गति पर Mistral और OpenAI की व्यापक तुलना को भी बढ़ावा देती है।

“लीक” की प्रकृति और मार्केटिंग से जुड़े सवाल

  • एक क्वांटाइज़्ड, वॉटरमार्क्ड 70B मॉडल (“miqu-1-70b”) Hugging Face पर दिखाई दिया; CEO ने इसे Llama-2–आधारित एक पुराना मॉडल बताया जो कभी शुरुआती-एक्सेस ग्राहकों को दिया गया था।
  • कुछ लोग इसे एक “बहुत उत्साही कर्मचारी” की लीक मानते हैं; अन्य लोगों को लगता है कि यह जानबूझकर की गई, चतुर PR चाल जैसी दिखती है।
  • Mistral ने takedown के लिए मजबूर नहीं किया; इसके बजाय उन्होंने एक हल्का-सा नोट छोड़ दिया, जिसे कई लोग आत्मविश्वास भरा, डेवलपर-फ्रेंडली रुख मानते हैं।

मॉडल क्षमता और GPT‑4 / GPT‑3.5 से तुलना

  • Mixtral और इसके डेरिवेटिव्स को लोकल रूप से चलाने वाले यूज़र्स रिपोर्ट करते हैं:
    • कई coding और discussion टास्क्स में गुणवत्ता GPT‑4 के करीब महसूस होती है, लेकिन hallucinations ज़्यादा हैं और self-correction कम है।
    • एक अन्य practitioner Mixtral-स्टाइल मॉडल्स को लगभग 5% GPT‑4-स्तर, लगभग 75% GPT‑3.5 के बराबर, और लगभग 20% खराब (बहुत बातूनी, hallucination-prone) रेट करता है।
  • API के ज़रिए Mistral Medium को अक्सर GPT‑3.5 के समान बताया जाता है; कुछ लोग इसे “3.5‑turbo और 4‑turbo के बीच” कहते हैं।
  • “Near GPT‑4” को कुछ लोग hype मानते हैं; अन्य इस बात पर ज़ोर देते हैं कि बहुत छोटे, सस्ते, अक्सर single‑GPU मॉडल्स के साथ इतना करीब पहुँचना महत्वपूर्ण है।

Guardrails, “nerfing,” और open models के प्रति पसंद

  • कई टिप्पणियों में शिकायत है कि OpenAI मॉडल्स अब strict safety और liability guardrails की वजह से कम मददगार हो गए हैं (खासकर कानूनी/contract मदद और बड़े टास्क्स के लिए), कभी-कभी आंशिक काम करते हैं या उपयोगकर्ताओं से experts से सलाह लेने को कहते हैं।
  • Mistral की API की प्रशंसा की जाती है क्योंकि वह guardrails को disable करने देती है और अधिक “adult” तथा कम paternalistic महसूस होती है।
  • कुछ लोग privacy, stability, और policy drift से बचने के लिए अपनी usage local/open models की ओर शिफ्ट कर रहे हैं।

Open source बनाम “open weights” और कानूनी/IP मुद्दे

  • इस पर बहस है कि क्या यह leak वास्तव में “open source” है या सिर्फ “open weights।”
  • कुछ लोग तर्क देते हैं कि AI में open source का मतलब होना चाहिए weights का free use, modification, और inspection, भले ही training data उपलब्ध न हो।
  • अन्य लोग ज़ोर देते हैं कि कई LLM licenses (जैसे field-of-use restrictions वाले) पारंपरिक free-software अर्थ में “open” नहीं हैं।
  • मॉडल weights पर copyright, database protection, या trade secrets लागू होते हैं या नहीं, इस पर लंबी legal thread हुई; नतीजा अभी स्पष्ट नहीं माना गया है।

Watermarking और quantization के विवरण

  • Watermarking के विचारों पर चर्चा हुई: weight perturbations, विशेष “shibboleth” tokens, और statistical output patterns।
  • Quantization को स्पष्ट किया गया कि यह weights की numeric precision कम करना है, “numeric sequences” को बदलना नहीं।
  • Leak GGUF quants (Q2/Q4/Q5) के रूप में आया; यह local use के लिए सुविधाजनक है लेकिन कुछ लोगों की नज़र में high-throughput production के लिए उपयुक्त नहीं।

Benchmarks, leaderboards, और evaluation bias

  • HuggingFace/LMSys leaderboards का संदर्भ दिया गया; कुछ लोग GPT‑4 “classic” और GPT‑4‑Turbo के बीच अंतर की ओर इशारा करते हैं।
  • अन्य लोग तर्क देते हैं कि leaderboards noisy होते हैं, sampling bias (dev/English-centric queries) से प्रभावित होते हैं, और Goodhart’s Law का जोखिम रखते हैं; वास्तविक क्षमताएँ (जैसे creative writing, niche languages, long-context उपयोग) कम मापी जा सकती हैं।