MonadGPT – अगर ChatGPT का आविष्कार 17वीं शताब्दी में हुआ होता तो क्या होता?
17वीं–18वीं शताब्दी के पाठों पर fine-tuned एक 7B-parameter language model, MonadGPT का लक्ष्य एक प्रारंभिक आधुनिक विचारक की तरह लिखना और तर्क करना है, जिससे इतिहास शिक्षा और प्रयोग के लिए immersive “time travel” बातचीत संभव हो सके। टिप्पणीकार ऐतिहासिक व्यक्तियों के बीच बहसों का सिमुलेशन, सांस्कृतिक संदर्भ सिखाने, और काल-विशिष्ट variants (जैसे Roman-era या केवल Latin models) बनाने जैसे उपयोग मामलों का पता लगाते हैं, साथ ही सीमित ऐतिहासिक corpora, उत्तरों में आधुनिक डेटा का “leaking,” और दोहरावदार output जैसी तकनीकी बाधाओं पर भी ध्यान देते हैं। कई लोगों को परिणाम मनोरंजक और खुलासा करने वाले लगते हैं, क्योंकि मॉडल की प्राचीन शैली विज्ञान, चिकित्सा, धर्म और राजनीति के बारे में पुरानी मान्यताओं को उजागर करती है, और दिखाती है कि LLMs अपने training data से कितने बंधे होते हैं.
ऐतिहासिक शिक्षा और उपयोग के मामले
- कई लोग इतिहास सिखाने में इसकी मजबूत संभावना देखते हैं, खासकर अतीत की संस्कृतियों के लिए केवल तिथियों और घटनाओं से अधिक, एक “time travel के लिए orientation” के रूप में।
- सुझाए गए उपयोग: प्रारंभिक आधुनिक व्यक्तियों के साथ सिम्युलेटेड बातचीत, ऐतिहासिक विचारकों के बीच बहसें, और खेलों में ऐतिहासिक रूप से आधारित NPCs।
- इस विचार को अन्य कालों और भाषाओं तक बढ़ाने में रुचि: रोमन-युग का Latin, मध्ययुगीन/प्रारंभिक आधुनिक French, “the 80s,” Old/early English, और विशेष विचारक (जैसे, Foucault)।
Training Data और भाषाई चुनाव
- मॉडल को आधुनिक instruction-following base (Mistral/OpenHermes) से fine-tune किया गया है, प्रारंभिक आधुनिक corpora पर; डेटा की सीमाओं के कारण पुराने पाठों पर शुरू से प्रशिक्षित नहीं किया गया।
- Dataset प्रकाशित है; भविष्य में 1000–2000 का बड़ा French ऐतिहासिक मॉडल योजनाबद्ध है।
- ऐतिहासिक वर्तनी और टाइपोग्राफी को संरक्षित रखने का जानबूझकर निर्णय लिया गया है (जिसमें long-s भ्रम भी शामिल है), हालांकि tokenizers को यह पसंद नहीं आता।
- यह बहस कि typography को normalize किया जाए या पहले एक “dictionary step” चलाया जाए।
मॉडल का व्यवहार और उदाहरण
- उपयोगकर्ता मनोरंजक outputs साझा करते हैं: essays, headaches, lightning, love melancholy, crypto-currency, और speculative 2023 पर सलाह, वह भी प्राचीन शैली में।
- कुछ उत्तर ऐतिहासिक रूप से “गलत” होते हुए भी उस दौर की सोच से मेल खाते हैं (जैसे physics, medicine, dog training)।
- दोहराए जाने वाले loops (“new engines…”, acid से बार-बार washing, अंतहीन “strike him again”) छोटे-model और sampling समस्याओं को उजागर करते हैं।
प्रामाणिकता और कालगत contamination
- मॉडल कभी-कभी 17वीं शताब्दी और आधुनिक आवाज़ के बीच स्विच करता है (जैसे Wikipedia-जैसी परिभाषाएँ, आधुनिक राजनीतिज्ञों या उत्पादों की जानकारी)।
- निर्माता एक जानबूझकर trade-off स्वीकार करता है: अच्छा instruction-following बनाम गहरा “cultural reset।”
- नकली archaisms के साथ prompt engineering इसे अतीत में anchored रखने में मदद करता है; सुझावों में आधुनिक शब्दों पर penalty लगाना या top layers को reinitialize करना शामिल है।
- कुछ उपयोगकर्ता इस बात से असंतुष्ट हैं कि आधुनिक ज्ञान “leak” हो जाता है, उनका तर्क है कि इससे time-travel illusion कमज़ोर पड़ता है।
तकनीकी पहलू और सीमाएँ
- Quantized GGUF versions उपलब्ध हैं; उपयोगकर्ता llama.cpp के साथ M-series Macs पर smooth local runs की रिपोर्ट करते हैं।
- छोटा 7B आकार और “weird” डेटा का मतलब है quantization quality और repetition के प्रति अधिक संवेदनशीलता।
- बेहतर sampling penalties और loops कम करने के लिए अधिक training के सुझाव दिए गए हैं।
दार्शनिक और वैचारिक बहसें
- चर्चा इस पर कि क्या LLMs ऐतिहासिक व्याख्याओं का परीक्षण कर सकते हैं या सिर्फ़ आत्मविश्वासी लेकिन अप्रमाणित rewrites उत्पन्न करते हैं।
- इस पर विवाद कि मॉडल का किसी चीज़ पर “believe” करना क्या अर्थ रखता है, बनिस्बत केवल tokens को manipulate करने के।
- प्रारंभिक पाठों से “zeitgeist” पुनर्निर्मित करने, जो elite-written हैं, पर skepticism, और thread title के alternate history exploration के वादे पर भी प्रश्न—सिर्फ़ style simulation नहीं।