Usando GPT-4 Vision com Vimium para navegar na web
Usando GPT‑4 Vision com a extensão Vimium do navegador, um projeto open source mostra como um agente de IA pode interpretar visualmente páginas da web e controlá-las por meio de “dicas” de clique no estilo teclado, navegando efetivamente em nome do usuário. Os comentaristas veem grande potencial para acessibilidade, automação robótica de processos e scraping em larga escala da web, mas levantam preocupações sobre privacidade, robustez em sites reais, custos e impacto ambiental. O tópico também explora refinamentos técnicos — como fornecer árvores de acessibilidade ou dados do DOM em vez de capturas de tela puras — e antecipa efeitos mais amplos sobre rastreamento de anúncios, empregos de entrada manual de dados e automação de testes.
Reação Geral
- Muitos comentaristas acham a demonstração “insana” e empolgante, especialmente como prova de conceito para agentes multimodais que podem operar um navegador.
- Outros questionam o valor direto para o usuário hoje, argumentando que é mais lento do que simplesmente digitar e clicar, e que é principalmente interessante como vislumbre do que agentes mais avançados poderiam fazer.
Acessibilidade e Privacidade
- Há forte otimismo de que ferramentas no estilo GPT-4 Vision irão melhorar muito a acessibilidade na web e talvez permitam um leitor de tela IA de ponta a ponta em alguns anos.
- Usuários cegos e com deficiência visual estão particularmente esperançosos, mas se preocupam com privacidade quando o conteúdo da tela é enviado para grandes modelos externos.
- Modelos de visão open source (por exemplo, CogVLM, LLaVA) são sugeridos como alternativas mais privadas.
Automação, RPA e Sistemas Legados
- Muitos veem isso como o próximo passo em Automação Robótica de Processos: automatizar entrada de dados, copiar entre GUIs legadas e fluxos de trabalho web frágeis.
- São compartilhadas histórias de cópia manual, truques com auto-clicker/VBA e procedimentos complexos de folha de pagamento/impostos que resistem a soluções tradicionais de API/ETL.
- Alguns estão construindo camadas genéricas de “automação de GUI” e infraestrutura de co-browsing pensadas para se integrar a modelos no estilo GPT-4V.
Abordagens Técnicas e Limitações
- Há debate sobre usar visão pura versus também fornecer árvores DOM/acessibilidade ou HTML/texto completo; vários relatam melhor confiabilidade com estruturas de texto.
- O sistema atualmente depende de capturas de tela com rótulos sobrepostos no estilo Vimium; sugestões incluem melhorar o estilo dos rótulos e enviar tanto imagens anotadas quanto limpas.
- A API de visão não tem modo JSON/function-calling embutido; alternativas incluem pós-processar sua saída com outro modelo.
- CAPTCHAs são explicitamente bloqueados pela OpenAI, embora alguns usuários relatem sucesso parcial em outras configurações.
- Custo e latência são preocupações recorrentes; limites de tokens e de imagens tornam o uso em larga escala ou sempre ativo caro.
Web Scraping, Anúncios e Bots
- As pessoas preveem camadas poderosas de scraping e “qualquer coisa como API” que funcionem a partir da saída visual, contornando truques anti-scraping do DOM.
- Alguns imaginam agentes que buscam conteúdo sem expor os usuários a anúncios ou rastreamento, embora capturas de tela ainda contenham anúncios.
- Surgem preocupações de que o tráfego de bots se torne indistinguível da navegação humana e sobre custos ambientais/de energia.
Riscos, Ceticismo e Impacto Futuro
- As preocupações incluem enshittification por meio de preços, impactos em empregos (por exemplo, QA, entrada de dados) e “automação da Sala Chinesa” do trabalho online.
- Alguns temem cenários de “início do fim” ou agentes sem supervisão, enquanto outros veem isso como a fase “Windows 95” de uma longa curva de adoção.