Usando GPT-4 Vision con Vimium para navegar por la web

Usando GPT‑4 Vision con la extensión de navegador Vimium, un proyecto de código abierto muestra cómo un agente de IA puede interpretar visualmente páginas web y controlarlas mediante indicaciones de “clic” al estilo teclado, navegando efectivamente en nombre del usuario. Los comentaristas ven un gran potencial para la accesibilidad, la automatización robótica de procesos y el scraping web a gran escala, pero plantean preocupaciones sobre la privacidad, la robustez en sitios reales, los costos y el impacto ambiental. El hilo también explora refinamientos técnicos —como alimentar árboles de accesibilidad o datos DOM en lugar de capturas puras— y anticipa efectos más amplios sobre el rastreo publicitario, los trabajos de entrada manual de datos y la automatización de pruebas.

Reacción general

  • Muchos comentaristas encuentran la demostración “insana” y emocionante, especialmente como prueba de concepto para agentes multimodales que pueden manejar un navegador.
  • Otros cuestionan el valor directo para el usuario hoy, argumentando que es más lento que simplemente teclear y hacer clic, y que sobre todo resulta interesante como una pista de lo que podrían hacer agentes más avanzados.

Accesibilidad y privacidad

  • Hay un fuerte optimismo de que herramientas estilo GPT-4 Vision mejorarán enormemente la accesibilidad web y quizá permitan un lector de pantalla de IA de extremo a extremo en unos años.
  • Los usuarios ciegos y con discapacidad visual son especialmente esperanzados, pero les preocupa la privacidad cuando el contenido de la pantalla se envía a grandes modelos externos.
  • Se sugieren modelos de visión de código abierto (p. ej., CogVLM, LLaVA) como alternativas más privadas.

Automatización, RPA y sistemas heredados

  • Muchos ven esto como el siguiente paso en la Automatización Robótica de Procesos: automatizar la entrada de datos, copiar entre GUIs heredadas y flujos de trabajo web frágiles.
  • Se comparten historias de copiado manual, trucos con auto-clicker/VBA y procedimientos complejos de nóminas/impuestos que resisten las soluciones tradicionales de API/ETL.
  • Algunos están construyendo capas genéricas de “automatización de GUI” e infraestructura de co‑navegación pensadas para combinarse con modelos tipo GPT‑4V.

Enfoques técnicos y limitaciones

  • Hay debate sobre usar visión pura frente a alimentar también árboles DOM/de accesibilidad o HTML/texto completo; varios informan de una mejor fiabilidad con estructuras de texto.
  • El sistema actualmente depende de capturas de pantalla con etiquetas superpuestas al estilo Vimium; se sugieren mejoras en el estilo de las etiquetas y enviar tanto imágenes anotadas como limpias.
  • La API de visión carece de modo JSON integrado/function-calling; los apaños incluyen posprocesar su salida con otro modelo.
  • Los CAPTCHA están bloqueados explícitamente por OpenAI, aunque algunos usuarios informan de éxito parcial en otros entornos.
  • El costo y la latencia son preocupaciones recurrentes; los límites de tokens y de imágenes hacen que el uso a gran escala o siempre activo sea caro.

Scraping web, anuncios y bots

  • La gente prevé potentes capas de scraping y de “cualquier cosa como API” que funcionen a partir de la salida visual, eludiendo trucos anti-scraping basados en DOM.
  • Algunos imaginan agentes que obtienen contenido sin exponer a los usuarios a anuncios ni rastreo, aunque las capturas de pantalla siguen conteniendo anuncios.
  • Surgen preocupaciones sobre que el tráfico de bots sea indistinguible de la navegación humana y sobre los costos ambientales/energéticos.

Riesgos, escepticismo e impacto futuro

  • Las preocupaciones incluyen la enshittification mediante precios, el impacto en el empleo (p. ej., QA, entrada de datos) y la “automatización de la Habitación China” del trabajo en línea.
  • Algunos temen escenarios de “principio del fin” o agentes sin supervisión, mientras que otros lo ven como la etapa de “Windows 95” de una larga curva de adopción.