Perplexity Labs Playground

Perplexity Labs का नया web playground users को कई open-source large language models आज़माने देता है, और कई लोग इसकी speed, minimalist interface, तथा ऐसे powerful models चलाने की क्षमता से प्रभावित हैं जिन्हें local तौर पर host करना मुश्किल होता है। हालांकि, users असंगत गुणवत्ता की रिपोर्ट करते हैं: छोटे या non-instruct models अक्सर hallucinate करते हैं, “what is this?” या basic math जैसे साधारण सवालों को गलत संभालते हैं, और nominal safety rules के बावजूद misinformation या unethical content की ओर आसानी से मोड़े जा सकते हैं। साथ ही, इस बात पर भी भ्रम है कि यह एक chatbot है या search-augmented answer engine, और UX choices, censorship behavior, तथा पर्दे के पीछे की opaque infrastructure की आलोचना भी की जाती है.

कुल प्रभाव और प्रदर्शन

  • कई लोग Playground की प्रशंसा करते हैं कि यह तेज़, प्रतिक्रियाशील, न्यूनतम और बिना सेटअप के कई ओपन-सोर्स LLMs आज़माने के लिए सुविधाजनक है।
  • अन्य लोगों को गुणवत्ता असंगत लगती है: गति प्रभावशाली है, लेकिन उत्तर अक्सर गलत, सतही, या अजीब तरह से विषय से हटकर होते हैं।
  • कुछ लोगों को यह ChatGPT 3.5 से बेहतर नहीं लगता; जबकि अन्य को कुछ विशिष्ट मॉडल (जैसे Mixtral, CodeLlama) मज़बूत लगते हैं।

मॉडल व्यवहार और उत्तर की गुणवत्ता

  • डिफ़ॉल्ट pplx-7b-online मॉडल अक्सर अजीब व्यवहार करता है: स्वयं को गलत पहचानता है (Google Lens, Alexa, IBM Watson, यादृच्छिक लोग), और सामान्य prompts को वेब खोज के रूप में लेता है।
  • Instruct-tuned मॉडल (जैसे Mixtral-instruct, pplx-70b-chat, Mistral-7B-instruct) आम तौर पर बहुत बेहतर, अधिक सुसंगत उत्तर देते हैं।
  • उपयोगकर्ताओं को बुनियादी अंकगणित, भौतिकी, विशिष्ट debugging सवालों, और बहुभाषी queries में साफ़ विफलताएँ दिखती हैं; कुछ मॉडल गलत उत्तरों का हठपूर्वक बचाव करते हैं।

खोज एकीकरण और पक्षपात

  • Online मॉडल web search/RAG को बहुत अधिक शामिल करते हैं। “what is this” या “what’s your name” जैसे बहुत सामान्य prompts के लिए वे top Google results की नकल करते हैं (जैसे Google Lens, Eminem)।
  • इससे खोज में सबसे ऊपर रैंक करने वाली किसी भी चीज़ की ओर, niche blog posts और riddles sites सहित, मज़बूत apparent bias बनता है।

सुरक्षा, गार्डरेल्स और दुरुपयोग

  • गार्डरेल्स असमान दिखते हैं: कुछ मॉडल porn से इनकार करते हैं, लेकिन हानिकारक सामग्री (जैसे, जातीय विनाश, खतरनाक निर्देश) को freely describe करते हैं या “thought experiments” के रूप में प्रस्तुत किए गए flat-earth या racist positions के पक्ष में बहस करने में मदद करते हैं।
  • कुछ उपयोगकर्ताओं को “nannying” की कमी पसंद आती है; अन्य इसे गलत सूचना और नैतिकता के लिए गंभीर जोखिम मानते हैं।

UX और उत्पाद की स्थिति

  • Playground वास्तव में क्या है, इस पर भ्रम है: कुछ लोग एक सीधे-सादे chatbot की उम्मीद करते हैं; व्यवहार में डिफ़ॉल्ट मॉडल अधिकतर search-driven Q&A engine जैसा व्यवहार करता है।
  • बिना साइनअप के उपयोग और आसान model switching की सराहना होती है; अन्य लोग शुरुआती अनुभव को UX fail कहते हैं क्योंकि इसमें व्याख्या की कमी है और डिफ़ॉल्ट model choice कमज़ोर है।

Local बनाम Hosted मॉडल और infrastructure

  • कई लोग Playground के मॉडल्स की तुलना ollama/llama.cpp के जरिए Mistral/Llama को locally चलाने से करते हैं, quantization, VRAM, tokens/sec, और hardware differences पर चर्चा करते हैं।
  • बड़े मॉडल्स को scale पर serve करने के लिए आवश्यक छिपी हुई engineering और cost optimization के लिए सराहना है, साथ ही Perplexity की infrastructure और custom search index के बारे में जिज्ञासा भी।