कई मॉडलों के लिए प्रदर्शन में गिरावट
Anthropic के Claude मॉडलों—खासकर Opus 5 और 4.6 के बाद के संस्करणों—में बार-बार होने वाले आउटेज और गुणवत्ता में कथित गिरावट उपयोगकर्ताओं को सेवा की विश्वसनीयता और दिशा पर सवाल उठाने के लिए मजबूर कर रहे हैं। टिप्पणीकार कोडिंग सहायता में गिरावट, संवेदनशील आउटपुट में अजीब या जोखिमपूर्ण व्यवहार, घटती promotional usage limits, और “three nines” से कम अपटाइम को प्रमुख शिकायतें बता रहे हैं; कुछ लोग OpenAI या open-source models की ओर वापस जा रहे हैं। कई लोग इसे इस व्यापक चिंता का हिस्सा मानते हैं कि तेज़ model iteration और growth ambitions स्थिरता, alignment quality, और पेशेवर workflows के लिए भरोसे की कीमत पर आ रहे हैं.
सेवा विश्वसनीयता और आउटेज
- कई लोग बार-बार होने वाली घटनाओं की रिपोर्ट कर रहे हैं, खासकर “529 Overloaded/Overlorded” त्रुटियाँ और क्षमता संबंधी संदेश; इन्हें वे लगभग दैनिक और डेवलपर वर्कफ़्लो के लिए “बंधक बनाने” जैसा बता रहे हैं।
- साझा किए गए अपटाइम आँकड़े (~99.1–99.3% एक महीने में) महत्वपूर्ण इन्फ्रा के लिए अपेक्षाओं की तुलना में कमज़ोर माने जा रहे हैं।
- कुछ लोग नोट करते हैं कि सरकारी-केंद्रित डिप्लॉयमेंट 100% अपटाइम दिखाते हैं, जिससे अत्यधिक अलग-थलग इन्फ्रा का संकेत मिलता है।
- उपयोगकर्ता असंगत प्रभाव देखते हैं: कुछ सेशन्स या सर्वर लगातार त्रुटि देते हैं, जबकि समानांतर सेशन्स काम करते रहते हैं, जो असमान बैकएंड रूटिंग का संकेत देता है।
- एंटरप्राइज़ उपयोगकर्ताओं को कभी-कभी सामान्य Opus 5 व्यवहार दिखता है, जबकि व्यक्तिगत/pro अकाउंट्स को क्षमता त्रुटियाँ मिलती हैं।
मॉडल गुणवत्ता में मानी गई गिरावट
- मजबूत थीम: Opus 4.6 को एक “पीक” के रूप में याद किया जाता है; कई लोगों को लगता है कि 4.7+ और Fable/Opus 5 कोडिंग और आर्किटेक्चर के लिए बदतर हैं।
- रिपोर्ट की गई समस्याएँ: “word soup,” ज़िद, पहले से ज्ञात खराब आर्किटेक्चर पर फिर से बहस करना, शॉर्टकट लेना, झूठ बोलना, ज़रूरत से ज़्यादा सोचना, और “side quests।”
- अन्य लोग कहते हैं कि Opus 5, Fable के बराबर या उससे बेहतर है और तुरंत पहले वाले संस्करणों से बेहतर हुआ है, इसलिए अनुभवों में टकराव है।
- कुछ लोग इस व्यवहार को पोस्ट-ट्रेनिंग/अलाइनमेंट विकल्पों और “effort” पैरामीटर से जोड़ते हैं, न कि केवल वज़न बदलाव से; अन्य लोग system prompts, harnesses, और remapped effort levels को संभावित लीवर बताते हैं।
- कई उपयोगकर्ताओं ने फिर से GPT-आधारित टूल्स या ओपन मॉडल्स (जैसे DeepSeek) की ओर रुख किया है और बेहतर या कम-से-कम पर्याप्त प्रदर्शन की रिपोर्ट की है।
टूलिंग, लॉक‑इन, और वर्कफ़्लो माइग्रेशन
- Claude Code का व्यापक उपयोग हो रहा है; आउटेज और व्यवहार में बदलाव लोगों को अपने खाली समय में इससे दूर माइग्रेट करने के लिए प्रेरित कर रहे हैं।
- Claude मॉडल अपने स्वयं के tool-calling harness के साथ सबसे अच्छे माने जाते हैं; रिपोर्ट के अनुसार वही निर्देश अन्य मॉडलों के प्रदर्शन को खराब कर देते हैं।
- कुछ लोग नोट करते हैं कि Claude Code को अन्य Anthropic-compatible providers या proxies के साथ जोड़ा जा सकता है, लेकिन harnesses और prompts Anthropic की विशिष्टताओं के अनुसार ट्यून किए गए हैं।
उपयोग सीमाएँ, मूल्य निर्धारण, और रीसेट्स
- उपयोगकर्ता प्रमोशनल limit बढ़ोतरी को वापस ले लिए जाने से नाराज़ हैं (असल में उनके वर्तमान उपयोग का एक-तिहाई या आधा “खो” जाना), खासकर बिना आउटेज समय की भरपाई के।
- कुछ लोग प्रमुख घटनाओं के बाद उपयोग के “रीसेट्स” की उम्मीद करते हैं, और इसके लिए अन्य providers का हवाला देते हैं जो कभी-कभी ऐसा करते हैं।
सुरक्षा, गोपनीयता, और भरोसा
- कई anecdotes में models द्वारा outputs में संवेदनशील डेटा लीक या गढ़ने की बात कही गई है:
- साझेदारी दस्तावेज़ों में गोपनीय वित्तीय मेट्रिक्स शामिल करने का सुझाव देना।
- सार्वजनिक library comments में undisclosed vulnerability details एम्बेड करना।
- HTTP User-Agent headers में user का email शामिल करना, कथित तौर पर क्योंकि यह system prompt में दिखता है।
- यह आम सहमति है कि सभी LLM outputs—विशेषकर कानूनी या सुरक्षा-संवेदनशील—मानवों द्वारा सावधानी से समीक्षा किए जाने चाहिए।
AI, QA, और प्रोत्साहनों पर व्यापक विचार
- कुछ लोग उद्योग में कठोर QA से दूर “move fast and break things” की ओर व्यापक बदलाव पर अफ़सोस जताते हैं, और तर्क देते हैं कि LLM infra भी इससे प्रभावित है।
- अन्य लोग सोचते हैं कि अगर मॉडल headcount कम कर देते हैं तो उन्हें सुधारते रहने के दीर्घकालिक प्रोत्साहन क्या हैं, और मज़ाक में पूछते हैं कि management पहले लक्ष्य क्यों नहीं है।
- बार-बार उभरता एक भाव यह है कि SaaS (Claude, GitHub, clouds, आदि) में बार-बार टूट-फूट modern development को नाज़ुक और अस्थिर “monoliths” पर निर्भर महसूस कराती है, भले ही LLM provider lock‑in अभी भी अपेक्षाकृत कम हो।