Ask HN: आप कौन-सा डिफ़ॉल्ट मॉडल इस्तेमाल करते हैं और क्यों?

AI power users अलग-अलग “डिफ़ॉल्ट” language models की ओर बढ़ रहे हैं, और उनका चुनाव raw benchmark scores से ज़्यादा लागत, गति, और क्षमता के संतुलन पर आधारित है। कई लोग रोज़मर्रा की coding और automation के लिए DeepSeek Flash, GLM 5.3, Gemini Flash, या Luna जैसे सस्ते, तेज़ मॉडल पसंद करते हैं, जबकि Opus, Fable, Sol, या Astra जैसे महँगे frontier models को complex planning और review के लिए—या फिर उनकी verbosity और ऊँची token costs के कारण पूरी तरह छोड़ देते हैं। एक लगातार उभरता विषय multiple models (और कभी-कभी local open-weight setups) को मिलाकर workflows बनाना है, ताकि privacy, reliability, और budget में संतुलन रखा जा सके; कुछ लोग तर्क देते हैं कि आज “सबसे बुद्धिमान” single model को追ने से ज़्यादा important thoughtful harness और test design है।

मॉडल विकल्प और उपयोग के मामले

  • विविधता बहुत अधिक है; कोई एक “डिफ़ॉल्ट” विजेता नहीं।
  • आम “वर्कहॉर्स”: DeepSeek v4.1 Flash, GLM‑5.3‑Flash, GPT 5.6 Luna/Terra, Gemini 3.x Flash, Composer, Muse Spark।
  • Frontier मॉडल्स (Opus, Fable, Astra, Sol, Grok) ज़्यादातर प्लानिंग, कठिन बग्स, या बड़े कोडबेस की समीक्षा के लिए आरक्षित रहते हैं।
  • कुछ लोग रोज़मर्रा की कोडिंग और लॉग्स के लिए सस्ते/तेज़ मॉडल इस्तेमाल करते हैं, और केवल अटकने पर Opus/Fable/Sol/Astra पर स्विच करते हैं।
  • कुछ लोग LLMs का बिल्कुल उपयोग नहीं करते।

लागत, टोकन उपयोग, और कीमत को लेकर निराशा

  • बहुत से लोग कीमत/प्रदर्शन के हिसाब से ऑप्टिमाइज़ करते हैं; छोटे व्यक्तिगत बजट DeepSeek, GLM, Luna, Qwen, Gemma, स्थानीय मॉडल्स को तरजीह देते हैं।
  • टोकन सीमाओं के अनुभव बहुत अलग-अलग हैं: कुछ लोग बड़े “20x”‑स्टाइल प्लान्स खत्म ही नहीं कर पाते, जबकि कुछ multi-agent factories और लगातार devops के साथ इन्हें एक दिन में ही खर्च कर देते हैं।
  • कई लोगों को लगता है कि सामान्य dev कार्यों के लिए उच्च-स्तरीय Anthropic ऑफ़रिंग्स बहुत महँगी हैं; जबकि अन्य सुविधा और US-आधारित वेंडर्स के लिए खुशी-खुशी भुगतान करते हैं।

गति, क्षमता, और verbosity

  • तेज़ प्रतिक्रिया को बहुत महत्व दिया जाता है; DeepSeek, GLM, Gemini Flash को अधिकांश web/mobile या SWE काम के लिए “blazing fast” और “good enough” कहा गया।
  • नए Claude/Opus लेखन-शैली के प्रति काफ़ी विरोध है: बहुत verbose, अलंकारिक, सतर्क, और पढ़ने में कठिन; पुराने Opus संस्करण अधिक पसंद किए जाते हैं।
  • GPT Sol/Luna, Astra, और कुछ open-weights को अधिक संक्षिप्त, तथ्यपरक आउटपुट के लिए सराहा गया।
  • कुछ लोगों का कहना है कि frontier मॉडल टेस्ट पास कर लेते हैं, फिर भी छिपा हुआ tech debt पैदा करते हैं; harness/test design को महत्वपूर्ण माना गया।

वर्कफ़्लो और orchestration पैटर्न

  • आम पैटर्न: मुख्य agent के रूप में सस्ता मॉडल + planner/reviewer/advisor के रूप में स्मार्ट मॉडल।
  • orchestrators, sub-agents, और “software factories” का उपयोग बढ़ रहा है, लेकिन इससे टोकन उपयोग बहुत बढ़ सकता है।
  • कई लोग पूरी तरह autonomous agents की बजाय सख़्त human control के साथ “centaur” मोड पसंद करते हैं।

Local बनाम hosted, भरोसा, और नैतिकता

  • कुछ लोग privacy, credential handling, और perceived surveillance या policy issues से बचने के लिए local Qwen/Gemma/GLM/DeepSeek की ओर जाते हैं।
  • कुछ लोग काम पर Chinese models का उपयोग करने से रोके जाते हैं, भले ही वे निजी तौर पर उनका उपयोग करते हों।
  • पर्यावरणीय प्रभाव और US बनाम Chinese AI labs की geopolitical alignment पर बहस होती है; कोई सहमति नहीं है।

समग्र भावना

  • यह thread अत्यधिक fragmentation दिखाता है: कई viable defaults, मज़बूत व्यक्तिगत प्राथमिकताएँ, और यह एहसास कि model choice अक्सर workflow, steering, और cost discipline से कम महत्वपूर्ण होता है।