Show HN: Dalle-3 और GPT4-Vision फीडबैक लूप
एक साधारण web app जो DALL·E 3 image generation को GPT‑4 Vision के image-to-text prompts के साथ लूप में चलाता है, लोगों को यह देखने के लिए प्रेरित कर रहा है कि multiple iterations में visual ideas कैसे “evolve” होती हैं, और अक्सर वे surreal, cosmic, या steampunk themes की ओर drift करती हैं। Commenters इसे Telestrations या exquisite corpse जैसे party games के automated version की तरह लेते हैं, और custom prompts, language translation, तथा constraints के साथ प्रयोग करके देखते हैं कि कौन-से elements स्थिर रहते हैं और कौन-से जल्दी distort हो जाते हैं। रचनात्मक मज़े के साथ-साथ, OpenAI के safety filters, rate limits, और diversity directives की भी जाँच-पड़ताल हो रही है, साथ ही third-party tools में API keys paste करने को लेकर चिंता और official ChatGPT image UI से निराशा भी है।
अवधारणा और समग्र प्रतिक्रियाएँ
- टूल DALL·E 3 और GPT‑4 Vision को एक चेन में जोड़ता है: हर छवि का GPT‑4V द्वारा वर्णन किया जाता है, फिर उसे एक नए प्रॉम्प्ट में बदला जाता है, और फिर DALL·E द्वारा दोबारा रेंडर किया जाता है, जिससे छवियों का एक “टेलीफोन गेम” जैसा क्रम बनता है।
- कई टिप्पणियाँ खुशी और मनोरंजन व्यक्त करती हैं; लोग अतियथार्थवादी शृंखलाएँ साझा करते हैं (corgis, gnomes, goats, AI का खुद को पेंट करना, Earth cycles, आदि)।
- कुछ लोगों को यह रचनात्मक रूप से प्रेरक लगता है; अन्य कहते हैं कि आउटपुट शोरयुक्त, दोहरावदार, या “चीजी” हैं, जो AI art को लेकर उनकी मौजूदा शंकाओं को और मजबूत करता है।
प्रॉम्प्ट डिज़ाइन और विकास पैटर्न
- कस्टम “मेटा-प्रॉम्प्ट्स” बहुत मायने रखते हैं: जैसे “हर चीज़ को corgis से बदल दो,” “इसे और whimsical बनाओ,” “हर बार intensity बढ़ाओ,” “इसे और अजीब बनाओ,” या “इसे किसी खास lens से वर्णित करो।”
- लंबे, अत्यंत विस्तृत वर्णन छवियों को iterations के बीच अधिक self-similar बनाते हैं; बहुत छोटे टेक्स्ट में संक्षेप करने से drift बढ़ता है।
- कई लोग कुछ तयशुदा tropes की ओर convergence नोट करते हैं: cosmic/space, mushrooms, steampunk, futuristic cityscapes, psychedelic posters।
- बहु-विषयक प्रॉम्प्ट अक्सर एक ही प्रमुख विषय की ओर सिमट जाते हैं, आम तौर पर पहले उल्लेखित विषय की ओर।
मॉडल का व्यवहार और “समझ”
- कुछ लोग प्रभावशाली visual coherence देखते हैं (सही shadows, reflections, 3D-like structure) और स्थिर themes भी।
- अन्य लोगों का तर्क है कि GPT‑4V अक्सर छवियों का गलत वर्णन करता है, ऐसे तरीकों से जो कोई इंसान नहीं करेगा, जिससे real “understanding” की बजाय pattern-matching का संकेत मिलता है।
- इस पर बहस है कि apparent misalignment मॉडल की सीमाओं के कारण है या image → short text की अंतर्निहित lossy compression के कारण।
सुरक्षा, पूर्वाग्रह और कंटेंट फ़िल्टर
- उपयोगकर्ता अक्सर safety rejections और अस्पष्ट “rate limit” या “unsupported image” त्रुटियों से टकराते हैं; व्यवहार को असंगत और कभी-कभी भ्रामक बताया गया है।
- DALL·E के लिए साझा internal prompt text, लोगों के चित्रण में diversity (race/gender mixing) लागू करता दिखता है, जिसे कुछ लोग सराहते हैं और कुछ लोग इसे तब दखलअंदाज़ी मानते हैं जब वे सांस्कृतिक रूप से विशिष्ट दृश्य चाहते हैं।
API, लागत और UI / फ़ीचर अनुरोध
- यह टूल front-end heavy है; लोग इसे OpenAI के default UI का तेज़, कम निराशाजनक विकल्प मानते हैं (जिसकी आलोचना धीमा, buggy, और prompts छिपाने के लिए की जाती है)।
- लोग rate limits, tiers, और प्रति iteration लागत पर चर्चा करते हैं; 10-image runs की लागत केवल कुछ सेंट होती है, लेकिन कुल मिलाकर बढ़ जाती है।
- माँगी गई विशेषताएँ: chains को fork करना, lineage का graph, uploaded image से शुरू करना, single-use या capped keys, 1-image/min limits का बेहतर handling, और share-link/“keep going” bugs को ठीक करना।
सुरक्षा और भावनात्मक प्रतिक्रियाएँ
- बहुत से लोग तीसरे पक्ष की साइटों में API keys paste करने से हिचकते हैं; कुछ temporary keys और revocation की सलाह देते हैं, जबकि अन्य अब भी असहज हैं।
- कुछ लोग AI art से एक तीव्र repulsion या uncanny “गलतपन” महसूस करने की बात कहते हैं, भले ही प्रयोग बौद्धिक रूप से रोचक लगे।