GPT-5.6, Claude, Gemini, और Grok के साथ मोना लिसा को “ड्रॉ” करना
GPT-5.6, Claude, Gemini, और Grok जैसे LLMs को केवल सरल डिजिटल पेंटिंग टूल्स का उपयोग करके मोना लिसा और Starry Night जैसी छवियाँ “ड्रॉ” करने का कार्य दिया गया, जिससे नियंत्रण, शैली, और लागत-दक्षता के बेहद अलग-अलग स्तर सामने आए। टिप्पणीकारों का कहना है कि भले ही परिणाम बचकाने या प्रतीकात्मक लगें—जैसे किसी शुरुआती कलाकार की कला—फिर भी ये टूल-उपयोग और दृश्य तर्क में आश्चर्यजनक उभरती क्षमताएँ दिखाते हैं, और GPT-5.6 अक्सर कहीं अधिक महंगे सेटअप्स से बेहतर प्रदर्शन करता है। यह चर्चा मूल्यांकन विधियों, प्रॉम्प्ट डिज़ाइन, मॉडल विशेषज्ञता, और क्या मानव-जैसी उपमाएँ (जैसे मॉडलों की तुलना बच्चों या तोतों से करना) वर्तमान AI प्रगति का सार्थक वर्णन करती हैं, जैसे सवाल भी उठाती है।
परीक्षण का उद्देश्य और वैधता
- कई टिप्पणीकार इस लेख को मुख्यतः एक मार्केटिंग/एंगेजमेंट लेख मानते हैं, न कि एक कठोर तुलना।
- आलोचनाओं में शामिल हैं: बहुत अलग-अलग मॉडलों पर एक जैसे प्रॉम्प्ट, हर मॉडल की “शैली” के अनुसार कोई अनुकूलन नहीं, स्थिरता के लिए बार-बार रन नहीं, और “undo/revert” टूल का अभाव, जिससे पीछे लौटने वाली रणनीतियों के खिलाफ झुकाव होता है।
- कुछ का तर्क है कि वास्तविक डिप्लॉयमेंट में आप हर मॉडल के लिए harness और prompting को अनुकूलित करेंगे, इसलिए यह head-to-head तुलना स्वभावतः सीमित है।
क्या LLMs ड्रॉइंग के लिए उपयुक्त हैं?
- कई लोग जोर देते हैं कि ये drawing tool का उपयोग करने वाले language models हैं, मूल image generators नहीं; इसलिए परिणामों को “बेकार” कहना अनुचित माना जाता है।
- फिर भी अन्य लोग आउटपुट को प्रभावशाली नहीं मानते और नोट करते हैं कि विशेषीकृत image models या image-capable chat systems कहीं बेहतर प्रदर्शन करते हैं।
- बेहतर harnesses में रुचि है: और अधिक tools, zoom/cropping, palette management, “undo,” और बेहतर similarity metrics का उपयोग (जैसे SSIM/RMSE के बजाय vision-model embeddings)।
मॉडल व्यवहार और शैली
- बहुत से लोग सहमत हैं कि GPT-5.6 “Sol” स्पष्ट विजेता है: अधिक सुसंगत, अधिक कुशल, और अधिक “charming,” खासकर rose और Starry Night पर।
- Grok की ड्रॉइंग्स को व्यापक रूप से भयावह रूप से खराब, surreal, या यीशु की पेंटिंग की कुख्यात गलत “restoration” जैसी बताया जाता है; कुछ लोग फिर भी उन्हें अंधेरे हास्यपूर्ण या भावनात्मक रूप से प्रभावशाली मानते हैं।
- Claude और अन्य मॉडलों को मध्यम स्तर का माना जाता है, जो कभी-कभी blending पर बहुत ज़्यादा ध्यान देते हैं या सीमित toolset का गलत उपयोग करते हैं।
“बालसुलभ” ड्रॉइंग और मानव-रूपकता
- एक बार-बार उभरने वाला विषय यह है कि आउटपुट शुरुआती या बाल कलाकारों के काम जैसे लगते हैं: icons पर आधारित “symbol drawing” (“blue = glass”) बजाय light, form, और value के।
- कुछ लोग इसे अजीब तरह से मानवीय-सा देखते हैं और कहते हैं कि यह मानव कलात्मक विकास के समानांतर है; अन्य इसका विरोध करते हैं, कहते हैं कि मॉडल वास्तव में “विकसित” नहीं होते, प्रयोगशालाएँ बस बेहतर संस्करण प्रशिक्षित करती हैं।
- LLMs को मानव-रूपकता देने बनाम उन्हें केवल उपकरण मानने पर बहस है, और कुछ लोगों को “stochastic parrot” उपमाओं के अत्यधिक उपयोग से निराशा है।
लागत, दक्षता, और अर्थशास्त्र
- टिप्पणीकार बड़े लागत अंतर को रेखांकित करते हैं, खासकर GPT-5.6 Sol और Fable के बीच, यह नोट करते हुए कि Sol बहुत कम tokens और dollars में बेहतर परिणाम हासिल करता है।
- कुछ लोग बताते हैं कि समय के साथ LLM उपयोग अधिक सस्ता और बेहतर महसूस हो रहा है; अन्य लोग कहते हैं कि वे कुल मिलाकर अभी भी अधिक भुगतान करते हैं, और इसका कारण per-unit cost के बजाय बढ़ा हुआ उपयोग बताते हैं।