K2 Horizon: छह खुले मॉडलों का एक जुड़ा हुआ बेड़ा

“रेडिकली ओपन” K2 Horizon भाषा मॉडलों का एक नया परिवार ध्यान आकर्षित कर रहा है, क्योंकि यह वेट्स और प्रशिक्षण डेटा के बड़े हिस्से प्रकाशित कर रहा है, और एक पूरी तरह पारदर्शी प्रशिक्षण पाइपलाइन देने का लक्ष्य रखता है। टिप्पणीकार एक और गंभीर ओपन-स्टैक प्रवेशकर्ता का स्वागत करते हैं—खासकर एक 7B मॉडल का, जो मामूली हार्डवेयर पर कोडिंग के लिए प्रतिस्पर्धी बेंचमार्क देता है—लेकिन नोट करते हैं कि बड़े वेरिएंट अभी भी Qwen जैसे शीर्ष खुले मॉडलों से पीछे हैं और कुछ रिपो तथा रेसिपी अधूरी हैं। यह रिलीज़ इस व्यापक बहस को भी फिर से जगाती है कि क्या पूरी तरह खुले मॉडल प्रशिक्षण डेटा को शामिल कर सकते हैं या करना चाहिए, कॉपीराइट और fair use कैसे लागू होते हैं, और क्या नए LLMs की तेज़ बाढ़ “मॉडल थकान” ला रही है।

मॉडल थकान, हाइप, और पिछले तकनीकी चक्रों से समानता

  • कई टिप्पणीकार लगातार नए रिलीज़ से “मॉडल थकान” व्यक्त करते हैं।
  • पहले के CPU और स्मार्टफोन हाइप युगों से तुलना की जाती है: शुरुआती लॉन्च बड़े आयोजन थे, अब केवल विशेषज्ञ हर नए चिप/फोन को ट्रैक करते हैं।
  • अपेक्षा है कि LLMs भी इसी तरह का रास्ता अपनाएँगे: अधिकांश उपयोगकर्ता बस “काफी अच्छा” मॉडल चुन लेंगे।
  • कुछ लोग नोट करते हैं कि “आपको ध्यान देने की ज़रूरत नहीं”; मॉडलों के साथ आप क्या बनाते हैं, वह फ्रंटियर रिलीज़ के पीछे भागने से अधिक मायने रखता है।

खुलापन, प्रशिक्षण डेटा, और “रेडिकली ओपन” दावे

  • पूरी तरह खुले स्टैक के लिए मजबूत समर्थन: वेट्स, कोड, प्रशिक्षण डेटा, और रेसिपी, ताकि ब्लैक-बॉक्स हेरफेर कम हो।
  • जब तक प्रशिक्षण डेटा और पूरी रेसिपी वास्तव में जारी नहीं होतीं, तब तक “रेडिकली ओपन” मार्केटिंग के प्रति संदेह।
  • कहा गया है कि K2 के प्रशिक्षण डेटासेट पहले से ही Hugging Face पर हैं, लेकिन प्री/पोस्ट-ट्रेनिंग रिपोज़ अभी भी प्लेसहोल्डर हैं।
  • उसी इकोसिस्टम के पिछले कार्य (जैसे, पहले के K2 मॉडल) से कुछ लोग उम्मीद करते हैं कि अंततः पूरी रेसिपी मिल जाएगी, लेकिन वे निर्णय सुरक्षित रखते हैं।

प्रदर्शन और बेंचमार्क

  • Dense 32B को (उनके अपने चार्ट्स के अनुसार) Qwen 3.8 27B जैसे मजबूत खुले प्रतिस्पर्धियों से पीछे बताया गया है; Gemma 4 31B तुलना सेट में नहीं है।
  • कुछ का तर्क है कि 32B को “stage 1” और अधूरा लेबल किया गया है, इसलिए शुरुआती रिलीज़ मुख्यतः खुले पाइपलाइन को दिखाने के बारे में है।
  • 7B मॉडल की बार-बार सराहना की गई है, संभावित रूप से “10B से नीचे सर्वश्रेष्ठ” और कोडिंग बेंचमार्क पर प्रतिस्पर्धी (जैसे, SWE-bench-verified स्कोर बड़े मॉडलों के बराबर)।
  • अन्य लोग रेखांकित करते हैं कि तुलना में नए मजबूत खुले मॉडल शामिल नहीं हैं और quantization क्लासेस/वेरिएंट्स को लगातार मेल नहीं कराया गया है।

कोडिंग क्षमताएँ और छोटे मॉडल

  • कुछ उपयोगकर्ता छोटे मॉडल (3.7B, 7B) को इंटरव्यू-शैली की कोडिंग समस्याओं पर आजमाते हैं।
  • रिपोर्टें: 3.7B बुनियादी कार्यों में विफल होता है, APIs के बारे में hallucinate करता है, और अटक जाता है; 7B मिश्रित या आंशिक रूप से सही उत्तर देता है।
  • बहस कि क्या sub-10B मॉडल गंभीर कोडिंग के लिए उपयुक्त हैं या सिर्फ autocomplete/summarization के लिए।
  • कुछ लोग अन्य छोटे कोडिंग मॉडलों से तुलना करते हैं जो पहले से ही ऐसे कार्य अच्छी तरह संभालते हैं।

टूलिंग, डिप्लॉयमेंट, और व्यावहारिकताएँ

  • K2 को लोकल रूप से चलाने में रुचि; उपयोगकर्ता vLLM सपोर्ट और अन्य मॉडलों के लिए हालिया dflash2 सपोर्ट का उल्लेख करते हैं।
  • निराशा कि नए रिलीज़ अक्सर vLLM को जल्दी सपोर्ट करते हैं लेकिन llama.cpp पर पीछे रह जाते हैं, जो पुराने/लो-एंड हार्डवेयर के लिए महत्वपूर्ण है।
  • टिप्पणियाँ कि होस्टेड K2 डेमो जब काम करता है तो बेहद तेज़ है, हालांकि शुरुआत में कुछ मॉडल उपलब्ध नहीं थे।

व्यापक IP, कॉपीराइट, और सिंथेटिक डेटा बहसें

  • इस पर लंबा उप-थ्रेड कि क्या मौजूदा कॉपीराइट कानून के तहत पूरी तरह खुले मॉडल संभव भी हैं।
  • चर्चा किए गए विचार:
    • गैर-अनुमेय स्रोतों से सिंथेटिक प्रशिक्षण डेटा उत्पन्न करने के लिए LLMs का उपयोग।
    • पूरी तरह सिंथेटिक या केवल सार्वजनिक-डोमेन कॉर्पस।
    • विकेंद्रीकृत प्रशिक्षण और भंडारण।
  • सभी सार्वजनिक रूप से पहुँचने योग्य इंटरनेट डेटा को सार्वजनिक डोमेन मानने के विवादास्पद प्रस्तावों को आगे रखा गया और उन्हें अव्यावहारिक व डिस्टोपियन बताकर कड़ी आलोचना की गई।
  • कुछ लोग मौजूदा प्रोजेक्ट्स (जैसे, OLMo/Dolma और समान) की ओर इशारा करते हैं, जो पारदर्शी पाइपलाइनों के आंशिक proof-of-concept हैं, भले ही अंतर्निहित स्क्रैप की गई सामग्री पूरी तरह पुनर्वितरण योग्य न हो।

विविध नोट्स

  • कुछ लोग गायब/लॉक्ड ब्लॉग चार्ट्स और छोटे, पढ़ने में कठिन विज़ुअल्स की शिकायत करते हैं।
  • नामकरण को लेकर भ्रम (“K2” पहले से कहीं और उपयोग में है)।
  • इस लॉन्च का बड़े बंद LLMs के प्रमुख आउटेज के साथ मेल खाना सराहना पाता है, जिससे खुले मॉडलों के कथित मूल्य को बल मिलता है।