वेब ब्राउज़ करने के लिए Vimium के साथ GPT-4 Vision का उपयोग

Vimium browser extension के साथ GPT-4 Vision का उपयोग करते हुए, एक open source project दिखाता है कि कैसे एक AI agent web pages को visually interpret करके keyboard-style “click” hints के माध्यम से नियंत्रित कर सकता है, और effectively user की ओर से browsing कर सकता है। टिप्पणीकारों को accessibility, robotic process automation, और large-scale web scraping के लिए बड़ा potential दिखता है, लेकिन privacy, real-world sites पर robustness, costs, और environmental impact को लेकर चिंताएँ भी हैं। चर्चा में technical refinements भी शामिल हैं—जैसे pure screenshots के बजाय accessibility trees या DOM data feed करना—और ad tracking, manual data entry jobs, तथा test automation पर व्यापक प्रभावों की उम्मीद की जाती है.

समग्र प्रतिक्रिया

  • कई टिप्पणीकार डेमो को “insane” और रोमांचक मानते हैं, खासकर एक ऐसे multimodal agent के proof-of-concept के रूप में जो browser चला सकता है।
  • कुछ लोग आज इसके सीधे user value पर सवाल उठाते हैं, यह तर्क देते हुए कि यह सिर्फ़ टाइप और क्लिक करने से धीमा है, और ज़्यादातर यह दिखाने के लिए दिलचस्प है कि अधिक उन्नत agents क्या कर सकते हैं।

Accessibility & Privacy

  • मजबूत आशावाद है कि GPT-4 Vision–style tools web accessibility को बहुत बेहतर बनाएँगे और कुछ वर्षों में एक end‑to‑end AI screen reader संभव कर सकते हैं।
  • Blind और visually-impaired users विशेष रूप से आशान्वित हैं, लेकिन privacy को लेकर चिंतित हैं जब screen content बड़े external models को भेजा जाता है।
  • Open‑source vision models (e.g., CogVLM, LLaVA) को अधिक private विकल्पों के रूप में सुझाया गया है।

Automation, RPA & Legacy Systems

  • कई लोग इसे Robotic Process Automation का अगला चरण मानते हैं: data entry को automate करना, legacy GUIs के बीच copy करना, और brittle web workflows को संभालना।
  • मैन्युअल copying, auto-clicker/VBA hacks, और जटिल payroll/tax procedures की कहानियाँ साझा की जाती हैं जो पारंपरिक API/ETL solutions का विरोध करती हैं।
  • कुछ लोग generic “GUI automation” layers और co‑browsing infrastructure बना रहे हैं, जिन्हें GPT-4V-like models के साथ जोड़ा जाना है।

Technical Approaches & Limitations

  • pure vision का उपयोग करने बनाम DOM/accessibility trees या full HTML/text भी feed करने पर बहस है; कई लोगों ने text structures के साथ बेहतर reliability रिपोर्ट की है।
  • सिस्टम वर्तमान में overlayed Vimium-style labels वाले screenshots पर निर्भर है; सुझावों में label styling सुधारना और annotated तथा clean दोनों images भेजना शामिल है।
  • Vision API में built-in JSON mode/function-calling नहीं है; workaround में इसके output को दूसरे model से post-process करना शामिल है।
  • CAPTCHAs को OpenAI ने स्पष्ट रूप से block किया है, हालांकि कुछ users अन्य setups में आंशिक सफलता रिपोर्ट करते हैं।
  • Cost और latency लगातार चिंताएँ हैं; token limits और image caps बड़े पैमाने या always-on उपयोग को महँगा बनाते हैं।

Web Scraping, Ads, and Bots

  • लोग शक्तिशाली scraping और “anything API” layers की कल्पना करते हैं जो visual output से काम करें, anti-scraping DOM tricks को bypass करते हुए।
  • कुछ लोग ऐसे agents की कल्पना करते हैं जो content fetch करें बिना users को ads या tracking के संपर्क में लाए, हालाँकि screenshots में ads फिर भी शामिल होते हैं।
  • bot traffic के human browsing से indistinguishable हो जाने और environmental/energy costs को लेकर चिंताएँ उठाई जाती हैं।

Risks, Skepticism & Future Impact

  • चिंताओं में pricing के माध्यम से enshittification, job impacts (e.g., QA, data entry), और online labor की “Chinese Room automation” शामिल हैं।
  • कुछ लोग “beginning of the end” जैसी स्थितियों या unsupervised agents से डरते हैं, जबकि अन्य इसे adoption curve के लंबे सफ़र का “Windows 95” चरण मानते हैं।