GPT-3.5 `useRalativeImagePath` के बारे में बहुत ज़्यादा सोचने पर क्रैश हो जाता है
GPT‑3.5 में एक अजीब बग है, जिससे `useRalativeImagePath` नाम के दुर्लभ टोकन के सामने आते ही वह त्रुटि करने या असंगत व्यवहार करने लगता है। यह संभवतः टोकनाइज़र और प्रशिक्षण डेटा द्वारा कुछ “ग्लिच टोकन” को संभालने के तरीके से जुड़ा है। टिप्पणीकार संभावित कारणों पर चर्चा करते हैं—मालफॉर्म्ड embeddings और numerical instability से लेकर post-processing filters और blacklisting तक—और नोट करते हैं कि GPT‑4, समान tokenizer साझा करने के बावजूद, अधिक मज़बूत दिखाई देता है। यह घटना डेटा गुणवत्ता, adversarial inputs, AI safety “kill words,” और वास्तविक दुनिया के अनुप्रयोगों में बड़े भाषा मॉडलों की व्यावहारिक reliability व performance पर व्यापक विचार-विमर्श को जन्म देती है।
ग्लिच टोकन, टोकनाइज़ेशन, और useRalativeImagePath
- कई टिप्पणीकार
useRalativeImagePathको GPT‑3.5/4 केcl100k_baseटोकनाइज़र में एक जाना-पहचाना “ग्लिच टोकन” मानते हैं। - परिकल्पना: ऐसे टोकन टोकनाइज़र के स्रोत कॉर्पस में अत्यंत बार-बार आए थे (जैसे Reddit उपयोगकर्ता नाम, टाइपो वाला Katalon XML विकल्प नाम), फिर मॉडल प्रशिक्षण से पहले बड़े पैमाने पर हटा दिए गए, जिससे उनके embeddings के पास कोई अर्थपूर्ण semantics नहीं बची।
- कोई पूर्व कार्य का लिंक देता है जो glitch tokens की सूची बनाता है और नोट करता है कि vocabulary ~100k tokens की है, 2^16 की नहीं।
- whitespace टोकनाइज़ेशन को प्रभावित करता है: glitch केवल तब दिखाई देता है जब
useRalativeImagePathसे पहले कोई space नहीं होता।
GPT-3.5 “क्रैश” क्यों करता है और LLM token कैसे generate करते हैं
- कई टिप्पणीकार इस बात पर ज़ोर देते हैं कि मॉडल logits + softmax के माध्यम से हमेशा fixed vocabulary से valid tokens ही output करता है।
- एक दृष्टिकोण: crash-जैसा व्यवहार शायद “invalid tokens” नहीं है, बल्कि downstream समस्याएँ हैं—जैसे इन tokens के लिए badly conditioned embeddings के कारण inference में numerical instability (NaNs), या OpenAI के serving stack में bugs/filters।
- दूसरे लोग special tokens और post-processing layers को त्रुटियों के संभावित स्रोत के रूप में उल्लेख करते हैं, लेकिन नोट करते हैं कि special tokens भी मॉडल से ही originate होते हैं।
- कुछ लोग सुझाव देते हैं कि token को पहले हुए “unspeakable token” incidents के बाद blacklist किया गया होगा। इसे अटकलबाज़ी के रूप में प्रस्तुत किया गया है।
सुरक्षा, shibboleths, और “kill words”
- कई उपयोगकर्ता “kill words” या “AI safe words” को जानबूझकर train करने के विचार पर टिप्पणी करते हैं, जो models को shut down कर दें, लेकिन दूसरे तर्क देते हैं कि यह एक insecure backdoor होगा और वैसे भी core “intelligence” के बजाय tokenizer level पर काम करता है।
- Glitch tokens की तुलना shibboleths से की जाती है: ऐसे वाक्यांश जिन्हें इंसान आसानी से दोहरा सकते हैं लेकिन जो LLMs को उलझा देते हैं, और जो bots व humans में अंतर करने के लिए उपयोगी हो सकते हैं।
Training data sources और bias
- Reddit (जिसमें /r/counting भी शामिल है) को training data होने की संभावना पर चर्चा होती है, इसके आकार के अनुमान और यह टिप्पणी कि ऑनलाइन सामग्री का बड़ा हिस्सा repetitive है।
- कुछ लोग अनुमान लगाते हैं कि शुरुआती ChatGPT political bias भारी Reddit उपयोग से आ सकता है।
Model behavior, censorship, और reliability
- उपयोगकर्ता GPT‑3.5/4 के कुछ prompts पर विफल होने या reset होने के अनुभव साझा करते हैं (जिसमें संवेदनशील विषय और obscure technical tasks शामिल हैं)।
- एक टिप्पणीकार नोट करता है कि GPT‑4 भी glitch token के साथ अजीब व्यवहार करता है, असंबंधित शब्दों को substitute करता है और खिंचे हुए explanations देता है।
Meta: UX और performance tangents
- कई टिप्पणियाँ GPT‑4 की API speed और context limits की आलोचना या रक्षा करती हैं, जिससे token limits और access पर एक गर्म subthread बनता है।
- पाठक blog की migraine-जैसी background की शिकायत करते हैं; लेखक बाद में इसे हटा देता है।