Cognition ने नया SWE-2 मॉडल लॉन्च किया, Fable 5.1 और GPT-Astra को टक्कर देता हुआ
Cognition का नया SWE-2 coding model, जिसे Kimi K3 पर post-training करके बनाया गया है, GPT-Astra और Fable 5.1 जैसे शीर्ष frontier models को टक्कर देने के रूप में पेश किया जा रहा है, लेकिन कई engineers को संदेह है कि इसके headline scores वास्तविक capability से अधिक पुराने, saturated benchmarks पर “benchmaxxing” का परिणाम हैं। टिप्पणीकार Terminal Bench 4 पर इसकी तेज़ गिरावट और closed weights की ओर इशारा करते हैं, यह तर्क देते हुए कि DeepSeek V4.1 Flash जैसे open models बेहतर price-performance और अधिक control देते हैं। अन्य लोग मानते हैं कि SWE-1.x पहले से ही काफी usable था, OpenAI/Anthropic पर निर्भरता कम करने के लिए Cognition द्वारा अपना खुद का fine-tuned stack चलाने में value देखते हैं, लेकिन इस बात से निराश हैं कि SWE-2 standard APIs या open distribution के बजाय Cognition के Devin tooling से tightly tied है।
बेंचमार्क, “Benchmaxxing,” और सामान्यीकरण
- कई टिप्पणीकार Cognition के self-published FrontierCode benchmark पर सवाल उठाते हैं, यह देखते हुए कि यह internal है, reproducible नहीं है, और SWE‑2 को “Astra/Fable” के बराबर बताता है।
- Terminal Bench 2.1 (≈93%) और Terminal Bench 4 (≈27%) के बीच का अंतर बार-बार overfitting/“benchmaxxing” और नए problems पर खराब generalization के लिए red flag के रूप में cited किया जाता है।
- अन्य लोग बताते हैं कि Sol और GLM जैसे top models भी TB2.1 से TB4 तक तेज़ी से गिरते हैं, यह तर्क देते हुए कि यह पूरे ecosystem की समस्या है और TB4 अभी saturated नहीं है।
- कुछ लोगों के लिए coding benchmarks increasingly low-signal marketing numbers बन गए हैं; वे इसके बजाय custom workloads बनाने की वकालत करते हैं।
मॉडल की उत्पत्ति, प्रशिक्षण, और क्षमताएँ
- SWE‑2 को “Kimi K3 से post-trained” बताया गया है, जिससे post-training बनाम distillation बनाम fine-tuning, और RL/post-training से कितनी अतिरिक्त capability आ सकती है, इस पर चर्चा हुई।
- इस बात पर बहस है कि क्या ~2.8T-parameter model वाकई ~10T-class models से मुकाबला कर सकता है; कुछ लोग संशय में हैं कि केवल RL उस अंतर को भर सकता है।
एक्सेस, प्रोडक्ट इंटीग्रेशन, और लॉक‑इन
- SWE‑2 फिलहाल मुख्यतः Cognition के Devin ecosystem (CLI, desktop/cloud) के माध्यम से उपलब्ध है, standard APIs या OpenRouter जैसे aggregators के जरिए नहीं।
- कुछ उपयोगकर्ताओं को सिर्फ एक lab के model को test करने के लिए bespoke CLI/harness की ज़रूरत पसंद नहीं आती, और वे एक simple chat/completions-style API की मांग करते हैं।
- pricing को लेकर भ्रम है: दावे हैं कि SWE‑2 CLI के जरिए एक महीने के लिए free है, cloud में discounted है, और on-device free है, लेकिन कुछ उपयोगकर्ताओं का कहना है कि उनसे charges लिए गए।
Open vs Closed Weights और Chinese Base Models
- कई टिप्पणीकार पूछते हैं कि क्या SWE‑2 open-weights है; अगर यह closed निकला तो निराशा व्यक्त की जाती है, खासकर DeepSeek V4.1 Flash और अन्य open Chinese models की तुलना में।
- चर्चा में यह भी नोट किया गया कि कई US startups अब scratch से training करने के बजाय मजबूत Chinese open models (Kimi, GLM, आदि) पर post-training या wrapping कर रहे हैं।
Devin/Windsurf प्रोडक्ट अनुभव
- Devin/Windsurf के साथ अनुभव मिश्रित हैं: कुछ enterprise और individual users इसे coding agent के रूप में उपयोगी पाते हैं, खासकर integrated frontier models के साथ।
- अन्य लोग CLI/desktop harness में गंभीर UX और reliability issues, key features की कमी, और पहले के overhyped demos की शिकायत करते हैं, जिससे अविश्वास पैदा हुआ है।
आर्थिक और प्रतिस्पर्धी संदर्भ
- टिप्पणीकार SWE‑2 को आंशिक रूप से OpenAI/Anthropic APIs पर निर्भरता कम करने के लिए Cognition के एक तरीके के रूप में देखते हैं।
- लागत-प्रदर्शन tradeoffs पर व्यापक बहस है, जिसमें कई लोग DeepSeek 4.1 Flash की एक मजबूत, सस्ती alternative के रूप में प्रशंसा करते हैं और closed labs की pricing पर दबाव की भविष्यवाणी करते हैं।