यदि दो हाथी पैरहीन हों, तो दस हाथियों के कितने पैर होंगे?

बड़े भाषा मॉडल अक्सर साधारण दिखने वाली गणित और तर्क पहेलियों में लड़खड़ा जाते हैं, जैसे कुछ हाथी “पैरहीन” हों तो उनके पैरों की गिनती करना, और उनकी गलतियाँ बुनियादी अंकगणितीय चूक से लेकर अजीबोगरीब व्याख्याओं तक जाती हैं। टिप्पणीकार इन विफलताओं का उपयोग यह दिखाने के लिए करते हैं कि LLMs सांख्यिकीय रूप से संभाव्य पाठ उत्पन्न करते हैं, न कि वास्तविक तर्क, और इस पर बहस करने के लिए कि क्या Python इंटरप्रेटर जैसे टूल जोड़ देने से यह अंतर वास्तव में कम होता है। थ्रेड में टोकनाइज़ेशन की विचित्रताओं, आम पहेलियों पर ओवरफिटिंग, और इन व्यवहारों का वर्तमान AI प्रणालियों की सीमाओं तथा AGI की आकांक्षाओं के लिए क्या अर्थ है, यह भी शामिल है.

समग्र विषय: LLMs और बुनियादी गणित/तर्क में विफलताएँ

  • थ्रेड एक सरल पहेली (“दस हाथी, जिनमें से दो पैरहीन हैं”) और इस बात पर केंद्रित है कि कैसे कई LLMs स्पष्ट रूप से गलत उत्तर देते हैं।
  • बताए गए उत्तरों में शामिल हैं: 32 (सही), 36, 38, 40, 64, 78, और यहाँ तक कि “अठारह,” अक्सर आत्मविश्वास भरे लेकिन असंगत तर्क के साथ।
  • कुछ मॉडल मान लेते हैं कि हाथियों के 8 पैर होते हैं, घटाने की प्रक्रिया को गलत लागू करते हैं, या “गायब” पैरों की दोहरी गिनती कर देते हैं। अन्य उल्टे प्रश्नों को गलत संभालते हैं (कुल पैरों की संख्या दी हो तो हाथियों की संख्या निकालना)।

जैसा कि थ्रेड में बताया गया है, LLMs को गणित में क्यों कठिनाई होती है

  • कई टिप्पणियाँ इस बात पर ज़ोर देती हैं कि LLMs संभाव्य अगले-टोकन पूर्वानुमानक हैं, न कि प्रतीकात्मक गणित इंजन या तर्क प्रणालियाँ।
  • संख्याएँ केवल टोकन हैं: 0, 10, 100 प्रत्येक एकल टोकन हो सकते हैं; 98 कई टोकनों में हो सकता है। मॉडल स्वाभाविक रूप से “संख्यात्मक तर्क” मोड में नहीं जाते।
  • अंकगणित/गणित प्रशिक्षण कॉर्पस का बहुत छोटा हिस्सा है और टोकनाइज़ेशन से खराब तरीके से मेल खाता है, इसलिए प्रदर्शन नाज़ुक और असमान होता है।
  • कुछ लोग इन गलतियों को इस बात का प्रमाण मानते हैं कि LLMs में वास्तविक समझ या तर्क नहीं है; अन्य तर्क देते हैं कि वे फिर भी शक्तिशाली पैटर्न मैचर हैं, बस गणित के लिए अनुकूलित नहीं थे।

टूल-उपयोग बनाम “शुद्ध” LLM व्यवहार

  • कई लोग नोट करते हैं कि GPT‑4 अक्सर हाथी और तारीख वाले प्रश्नों को Python कोड लिखकर और एक सैंडबॉक्स्ड इंटरप्रेटर में उसे चलाकर सही हल कर देता है।
  • इस पर बहस है कि क्या यह प्रभावशाली “सामान्यीकरण + टूल उपयोग” है, या सिर्फ एक ऑटोकम्प्लीट इंजन पर कैलकुलेटर जोड़ देना।
  • कच्चे LLM और आसपास की प्रणाली (LLM + टूल्स) के बीच स्पष्ट भेद किया जाता है।

मॉडलों और प्रॉम्प्ट्स के बीच असंगति

  • एक ही प्रॉम्प्ट से Bard, GPT‑3.5, GPT‑4, Claude, Mixtral, और Bing में अलग-अलग उत्तर मिलते हैं; यहाँ तक कि एक ही मॉडल समय के साथ अपना व्यवहार बदल सकता है।
  • कुछ छोटे या नए मॉडल सही उत्तर देते हैं; अन्य विचित्र तर्क देते हैं (जैसे, नकारात्मक पैरों को 1 तक ऊपर की ओर गोल करना)।
  • सामान्य पहेलियों पर ओवरफिटिंग देखी जाती है (जैसे, पंख/ईंट वाले रूपांतरों में हमेशा “उनका वजन समान है” कहना)।

व्यापक विचार-विमर्श

  • इन विफलताओं का उपयोग यह तर्क देने के लिए किया जाता है कि LLMs “सिर्फ ऑटोकम्प्लीट” हैं, और यह भी कि वे तेज़ी से बेहतर हो रहे हैं (विशेषकर बड़े मॉडलों और टूल्स के साथ)।
  • कई टिप्पणियाँ LLMs को तर्ककर्ता की बजाय अत्यधिक सक्षम “छँटाई करने वाले” या सहायक के रूप में देखती हैं, और इन पहेलियों को उनकी सीमाओं के अच्छे तनाव-परीक्षण मानती हैं।