将 GPT-4 Vision 与 Vimium 结合浏览网页

借助 GPT-4 Vision 与 Vimium 浏览器扩展,一个开源项目展示了 AI 智能体如何通过视觉理解网页,并用类似键盘“点击”提示来控制浏览器,从而代表用户浏览网页。评论者看到了其在可访问性、机器人流程自动化和大规模网页抓取方面的巨大潜力,但也对隐私、在真实网站上的鲁棒性、成本以及环境影响提出了担忧。讨论还探讨了技术改进——例如向模型输入可访问性树或 DOM 数据而不是纯截图——并预测其将对广告追踪、人工数据录入工作和测试自动化产生更广泛影响。

总体反应

  • 许多评论者认为这个演示“疯了”且令人兴奋,尤其是作为一个能够驱动浏览器的多模态智能体概念验证。
  • 也有人质疑它如今的直接用户价值,认为它比手动输入和点击更慢,而且更多只是让人看到更先进智能体未来可能做到什么。

可访问性与隐私

  • 很多人乐观地认为,GPT-4 Vision 这类工具将大幅提升网页可访问性,并可能在几年内实现端到端的 AI 屏幕阅读器。
  • 盲人和视障用户尤其抱有希望,但也担心屏幕内容发送给大型外部模型时的隐私问题。
  • 有人建议使用开源视觉模型(如 CogVLM、LLaVA)作为更私密的替代方案。

自动化、RPA 与遗留系统

  • 许多人认为这是机器人流程自动化的下一步:自动录入数据、在遗留 GUI 之间复制内容,以及处理脆弱的网页工作流。
  • 讨论中分享了手动复制、自动点击器/VBA 变通方案,以及一些复杂的工资/税务流程,这些场景很难被传统 API/ETL 方案解决。
  • 也有人正在构建通用的“GUI 自动化”层和协同浏览基础设施,打算与类似 GPT-4V 的模型配合使用。

技术路线与局限

  • 讨论集中在纯视觉方案与同时输入 DOM/可访问性树或完整 HTML/文本之间的取舍;不少人表示,文本结构的可靠性更高。
  • 目前系统依赖带有 Vimium 风格标签覆盖的截图;有人建议改进标签样式,并同时发送标注图和干净图像。
  • 视觉 API 没有内置 JSON 模式/函数调用;一种变通办法是用另一个模型对其输出进行后处理。
  • CAPTCHA 被 OpenAI 明确阻止,不过有些用户表示在其他设置中取得了部分成功。
  • 成本和延迟是反复出现的担忧;token 限制和图像上限使得大规模或常驻使用的代价很高。

网页抓取、广告与机器人

  • 人们预见到会出现强大的抓取与“任何东西都能 API 化”的层,它们可从视觉输出中工作,绕过反爬的 DOM 技巧。
  • 有人设想智能体在获取内容时不会让用户暴露于广告或追踪之下,但截图本身仍会包含广告。
  • 还有人担心机器人流量会变得与人类浏览难以区分,以及环境/能源成本问题。

风险、质疑与未来影响

  • 担忧包括通过定价实现“劣化”(enshittification)、对工作岗位的冲击(如 QA、数据录入)以及对线上劳动的“中文房间式自动化”。
  • 有人担心这会是“终局的开始”或出现不受监督的智能体;也有人认为这只是漫长采用曲线中的“Windows 95”阶段。