Claude 2.1
Anthropic के Claude 2.1 रिलीज़, जो 200k-token context window और कम hallucinations वाला एक large language model है, की तुलना coding ability, reasoning depth, speed, और reliability के लिहाज़ से OpenAI के GPT‑4/Turbo से की जा रही है। कई टिप्पणीकार complex programming और general knowledge के लिए Claude को GPT‑4 से कमज़ोर मानते हैं, लेकिन इसके long context और tone की प्रशंसा करते हैं, खासकर AWS Bedrock के ज़रिए उपयोग करने पर। निराशा का एक बड़ा कारण Anthropic की restrictive access, regional limitations (ख़ासकर EU और Canada में), और aggressive safety filters हैं, जो seemingly benign queries पर भी frequent refusals trigger करते हैं, जिससे इसे primary development platform के रूप में व्यावहारिकता को लेकर चिंताएँ बढ़ती हैं.
रिलीज़ का समय और प्रतिस्पर्धी संदर्भ
- कई लोग OpenAI की उथल-पुथल के बीच Claude 2.1 के लॉन्च को “सही समय” मानते हैं, और इसे जोखिम से बचने वाले एंटरप्राइज़ ग्राहकों को जीतने का अवसर समझते हैं।
- अन्य लोग मानते हैं कि समय-निर्धारण ज़्यादातर संयोग था या Thanksgiving के आसपास का सिर्फ़ एक छोटा-सा शेड्यूल बदलाव था।
मॉडल गुणवत्ता बनाम GPT-4 और अन्य
- कई पोस्ट करने वाले कहते हैं कि Claude 2/2.1 व्यावहारिक कोडिंग और रीजनिंग कार्यों के लिए GPT-4 (और कभी-कभी GPT-3.5) से काफ़ी खराब है; अधिक pseudocode, भूली हुई constraints, अधूरे outputs।
- एक अल्पसंख्यक अच्छे नतीजे रिपोर्ट करता है, ख़ासकर कई academic papers को summarize या review करने जैसे कार्यों और सामान्य chat के लिए, और कभी-कभी वे इसका tone GPT-4 से बेहतर पसंद करते हैं।
- कुछ लोगों को लगता है कि open-source models (जैसे Mistral, Llama variants) पहले से ही प्रतिस्पर्धी हैं या उनके उपयोग के लिए बेहतर हैं।
अस्वीकृतियाँ, सुरक्षा, और “over-alignment”
- एक प्रमुख विषय बार-बार, कभी-कभी अजीब, refusals से निराशा है: hypotheticals, exam prep, “ideologies” से जुड़ी vocabulary, benign safety/health questions, process-killing commands, आदि।
- आलोचक Claude को नैतिक उपदेश देने वाला, बहस करने वाला, या “parental” बताते हैं, जिससे इसे एक tool की तरह इस्तेमाल करना मुश्किल हो जाता है।
- समर्थक कहते हैं कि वे narrow domains (code, docs पर RAG) में refusals शायद ही देखते हैं और hallucinating से बेहतर demurring को मानते हैं।
- कुछ लोग तर्क देते हैं कि मजबूत guardrails वास्तव में ख़तरनाक domains (bioweapons, गंभीर नुकसान) के लिए स्वीकार्य या आवश्यक हैं।
Context window, hallucinations, और accuracy
- 200k context को आशाजनक माना जा रहा है, लेकिन स्वतंत्र परीक्षण की ज़रूरत है; लोग नोट करते हैं कि पिछले long-context models लगभग 32k tokens के बाद degrade हो जाते हैं।
- कम hallucinations और अधिक ईमानदार refusals पर Anthropic के अपने charts को सकारात्मक रूप से देखा गया है, लेकिन वे censorship “false positives” को संबोधित नहीं करते।
पहुँच, भौगोलिक सीमाएँ, और APIs
- बहुत से लोग शिकायत करते हैं कि उन्हें API access बिल्कुल नहीं मिल रहा या हफ़्तों/महीनों का इंतज़ार करना पड़ता है; application forms अस्पष्ट और हतोत्साहित करने वाले लगते हैं।
- EU, Canada, Brazil, आदि में उपलब्धता की कमी, साथ ही phone-number restrictions, बार-बार की परेशानी का कारण है।
- कुछ लोग इसे AWS Bedrock के ज़रिए bypass करते हैं और तेज़, automated access की रिपोर्ट करते हैं; दूसरों को फिर भी delays झेलनी पड़ती हैं।
- कई लोग कहते हैं कि इससे Claude एक platform के रूप में OpenAI के आसानी से उपलब्ध APIs की तुलना में बहुत जोखिमपूर्ण हो जाता है।
System prompts, prefilling, और नियंत्रण
- नए system prompts और Anthropic की “prefill” क्षमता power users के लिए दिलचस्प है, दोनों behavior को customize करने और (संभावित रूप से) refusals कम करने के लिए।
- दूसरों को चिंता है कि यह prompt design prompt-injection risk बढ़ाता है और वे नोट करते हैं कि OpenAI प्रभावी रूप से system और user text को इसी तरह concatenate करता है।