GPTs की पड़ताल: ट्रेंच कोट में ChatGPT?

OpenAI के नए “GPTs” — ChatGPT-आधारित अनुकूलन योग्य bots जिन्हें निर्देश, tools, और private knowledge bases दिए जा सकते हैं — AI agents को गैर-तकनीकी उपयोगकर्ताओं के लिए सुलभ बनाने की दिशा में एक शक्तिशाली लेकिन असमान कदम माने जा रहे हैं। टिप्पणीकार इन्हें Assistants API से तुलना करते हैं, इस पर बहस करते हैं कि ये clever prompt engineering से कितना आगे जाते हैं, और weak retrieval performance, opaque hidden prompts, तथा बाहरी डेटा और OAuth के साथ awkward integration जैसी व्यावहारिक समस्याएँ नोट करते हैं। फिर भी कई लोग मुख्य नवाचार को UX और distribution मानते हैं: GPTs विशेष agents बनाना और साझा करना आसान बनाते हैं, जबकि data collection, corporate control, और AI के अधिक customer तथा personal interactions के बीच आने को लेकर नई चिंताएँ भी बढ़ाते हैं.

GPTs बनाम Assistants API / तकनीकी अंतर

  • कई लोग GPTs को “प्री-प्रॉम्प्ट वाला ChatGPT” मानते हैं, यानी कस्टम सिस्टम निर्देशों के साथ वैकल्पिक टूल्स और फ़ाइलें।
  • Assistants API को अधिक लो-लेवल बताया गया है: थ्रेड्स, कॉन्टेक्स्ट इनिशियलाइज़ेशन, और UI पर अधिक नियंत्रण, लेकिन आपको फ्रंटएंड बनाना और polling संभालना पड़ता है।
  • कुछ लोगों के अनुसार व्यवहार में Assistants के साथ केवल सीमित अतिरिक्त नियंत्रण मिलता है; OpenAI फिर भी वार्तालाप प्रवाह को संचालित करता है।
  • एक उल्लेखनीय अंतर: एक ही thread से कई Assistants जोड़े जा सकते हैं, जबकि GPTs single-model होते हैं।

Actions, Function Calling, और Auth

  • GPTs OpenAPI specs से समर्थित “actions” के जरिए बाहरी APIs को कॉल कर सकते हैं, जो कार्यात्मक रूप से function calling के समान है।
  • GPT actions के लिए OAuth उपलब्ध है, लेकिन domain rules से सीमित है; सेटअप मुश्किल हो सकता है।
  • POST actions में अक्सर बार-बार “Allow/Deny” की आवश्यकता होती है; एक विशेष header (isConsequential: false) prompts कम कर सकता है।

RAG / “Knowledge” और File Handling

  • GPT “knowledge” वास्तव में RAG है: फ़ाइलों को chunk किया जाता है, embed किया जाता है, और एक vector database में संग्रहीत किया जाता है (कुछ flows के लिए संभवतः Qdrant, हालांकि अन्य Azure services का उल्लेख करते हैं)।
  • व्यवहार आकार पर निर्भर लगता है: छोटी फ़ाइलें prompts में inline हो सकती हैं; बड़ी collections अक्सर एक single text file में मिलाकर बेहतर काम करती हैं।
  • कई उपयोगकर्ता खराब या असंगत retrieval quality, citation control, और indexing failures की रिपोर्ट करते हैं, खासकर बहुत सारी या बड़ी फ़ाइलों के साथ।
  • Raw text files जटिल formats की तुलना में बेहतर काम करती हैं; PDFs/Markdown का परिणाम अनिश्चित हो सकता है।

Prompt Transparency और Control

  • GPT prompts और configuration के लिए “view source” विकल्प की प्रबल इच्छा है; कई लोग hidden instructions और अज्ञात APIs को लेकर सतर्क हैं।
  • उपयोगकर्ता नोट करते हैं कि चतुर queries के जरिए GPT prompts अक्सर leak हो सकते हैं; उन्हें छिपाने के प्रयास अक्सर विफल हो जाते हैं।
  • कुछ लोगों का तर्क है कि “view source” मुख्यतः power users के लिए उपयोगी होगा, लेकिन community-driven सुधार को बढ़ावा दे सकता है।

Use Cases और UX Impressions

  • रिपोर्ट किए गए उपयोगों में शामिल हैं: retro game consoles, domain-specific analysts, training/workshop automation, technical documents पर RAG, personal assistants, और JavaScript Code Interpreter के साथ प्रयोग।
  • GPTs को गैर-तकनीकी उपयोगकर्ताओं के लिए एक बड़ा UX win माना गया है, जिन्हें system prompts और custom instructions में दिक्कत होती है।
  • अन्य लोग इन्हें base model को सीधे prompt करने की तुलना में अनावश्यक “toys” मानते हैं।

Risks, Data, और Business Concerns

  • चिंताओं में शामिल हैं: shovelware content, corporate customer-service deflection, dehumanizing efficiency, और OpenAI द्वारा uploaded documents तथा user creativity को competitive moat के रूप में इकट्ठा करना।
  • कुछ लोगों के लिए यह स्पष्ट नहीं है कि GPT-uploaded documents का उपयोग model training के लिए किया जाता है या नहीं; कहा जाता है कि API uploads का उपयोग नहीं किया जाता।