GLM-5.3 (open-weight) ने Anthropic/OpenAI मॉडलों को पछाड़ा – 1/5 लागत पर
दावे कि Chinese GLM‑5.3 मॉडल OpenAI और Anthropic के प्रमुख सिस्टमों से बहुत कम लागत पर बेहतर है, ने LLMs के benchmarking और तुलना के तरीके पर जांच को तेज़ किया है। टिप्पणीकार उद्धृत परीक्षणों की वैधता पर सवाल उठाते हैं (छोटे, saturated, अक्सर तुच्छ कार्य, AI-generated लेखन) और नोट करते हैं कि safety refusals, prompt harnesses, तथा enterprise procurement और compliance अक्सर कच्चे स्कोर से अधिक महत्वपूर्ण होते हैं। कुछ उपयोगकर्ता GLM‑5.3 का वास्तविक दुनिया में प्रभावशाली प्रदर्शन बताते हैं, खासकर reverse engineering जैसे कार्यों पर, लेकिन कई लोगों का तर्क है कि open या Chinese models अभी भी general capability में frontier US models से पीछे हैं और भू-राजनीतिक व licensing जोखिमों से जटिल हैं।
बेंचमार्क की विश्वसनीयता और कार्यप्रणाली
- कई लोग इस बेंचमार्क को पहले से ही भरा हुआ मानते हैं: ~10 मॉडलों का >95% स्कोर करना बताता है कि कार्य बहुत आसान हैं या भेदकारी नहीं हैं।
- कोडिंग मूल्यांकन की आलोचना की जाती है कि वे तुच्छ हैं (कुछ ही, सरल Python कार्य; कुल 28 कार्य), इसलिए मॉडलों के बीच के अंतर शायद अर्थपूर्ण नहीं हैं।
- कई लोग अन्य लीडरबोर्ड्स (जैसे ArtificialAnalysis, LMSys Arena) के साथ असंगतियों की ओर इशारा करते हैं, और Haiku का बहुत ऊँचा स्कोर या GPT 5.5 > 5.6 जैसे परिणाम लाल झंडे माने जाते हैं।
- कुछ का कहना है कि Fable का कम स्कोर मुख्यतः refusals के कारण है, न कि कच्ची क्षमता के कारण; जबकि अन्य तर्क देते हैं कि refusals को विफलता के रूप में गिनना “वास्तविक दुनिया” के मूल्यांकन के लिए उचित है।
- कुल मिलाकर, कई टिप्पणीकार इस बेंचमार्क और लेख को “slop” मानते हैं और मॉडल चयन के लिए गंभीर आधार नहीं समझते।
GLM-5.3 की क्षमताएँ और लागत
- कई उपयोगकर्ता GLM-5.3 (और संबंधित Kimi मॉडलों) को मजबूत प्रदर्शनकर्ता बताते हैं, खासकर reverse engineering, tool use, planning, और harnesses में coding के लिए।
- कुछ का कहना है कि यह उनके व्यक्तिगत/डेवलपमेंट वर्कलोड में उच्च-स्तरीय closed models की जगह काफी कम लागत पर ले सकता है; दूसरों को यह धीमा, overengineered, या GLM-5.1 से स्पष्ट रूप से बेहतर नहीं लगता।
- एक अलग मूल्यांकन का हवाला दिया गया है जहाँ GLM-5.3 लगभग #6 पर है और कीमत/प्रदर्शन के लिहाज़ से Grok और Sol के मुकाबले Pareto-optimal नहीं है।
Open weights, safety, और refusals
- GLM-5.3 weights अभी जारी नहीं हुए हैं; देरी का कारण safety nerfs बताया जाता है, जिससे कुछ लोग चिंता करते हैं कि क्षमता घट सकती है, जबकि अन्य कहते हैं कि इन्हें fine-tune करके हटाया जा सकता है।
- US मॉडलों के safety filters और refusals को लेकर व्यापक निराशा है, खासकर security, reverse engineering, और “autonomous” coding tasks के लिए।
एंटरप्राइज़ और भू-राजनीतिक विचार
- कई लोग तर्क देते हैं कि enterprise छोटे गुणवत्ता-अंतर के बावजूद integrations, procurement, और compliance के कारण US big-tech मॉडलों के लिए भुगतान जारी रखेंगे।
- अन्य लोग दोनों दिशाओं में supply-chain और political risks पर ज़ोर देते हैं: US सरकार US models को सीमित कर सकती है, और इसी तरह Chinese models को भी निशाना बना सकती है, जिससे contractors प्रभावित होंगे।
- गैर-US संगठन US providers के साथ अधिक जोखिम महसूस कर सकते हैं।
विश्वास, AI-लिखित सामग्री, और propaganda संबंधी चिंताएँ
- कई लोगों का मानना है कि लेख और साइट भारी मात्रा में या पूरी तरह AI-generated हैं और खराब तरीके से संपादित किए गए हैं; इससे परिणामों पर भरोसा बहुत कम हो जाता है।
- कुछ इसे “AI slop” कहते हैं और HN पर AI-generated सामग्री के फैलाव को लेकर चिंतित हैं।
- कुछ लोग Chinese models को बढ़ावा देने के लिए astroturfing या propaganda की संभावना का उल्लेख करते हैं, हालांकि यह tone और results से आगे substantiated नहीं है।