Show HN: copiloto de IA para macOS de código aberto usando visão e voz
Um app “copiloto” de código aberto para macOS que usa Electron, as APIs de visão e voz da OpenAI e captura de tela para ajudar usuários a interagir com o que está na tela está gerando tanto entusiasmo quanto ceticismo. Defensores gostam da utilidade prática para tarefas como depuração, produção musical e aprendizado de softwares complexos, e apreciam que seja fácil de estender ou adaptar para modelos locais. Críticos levantam preocupações sobre o desempenho do Electron, a dependência da nuvem da OpenAI (custos, privacidade e políticas corporativas) e a ausência de entrada apenas por texto, o que leva a sugestões de implementações nativas em Swift, modelos multimodais locais e integração mais estreita com o sistema operacional.
Recepção geral
- Muitos comentadores acham o app “muito legal” e um bom MVP no estilo “Show HN”, especialmente para aprender software complexo mais rápido (por exemplo, Ableton Live).
- Outros são céticos quanto à utilidade real, observando que algumas demos parecem genéricas e lembram Eliza, com respostas lentas e aparente compreensão limitada do conteúdo.
- Vários elogiam o conceito de “LLM como interface” e preveem que assistentes de voz/visão se tornarão normais em dispositivos e sistemas operacionais.
Stack tecnológico (Electron vs nativo)
- Alguns criticam o uso de Electron para uma ferramenta específica de macOS, citando preocupações com desempenho e integração com o sistema operacional.
- Outros argumentam que Electron é uma escolha pragmática para um primeiro projeto e para MVPs rápidos; a escolha da stack é vista como secundária em relação a entregar e aprender.
- As sugestões incluem Swift/SwiftUI, AppKit, ou alternativas como Tauri para apps menores e com sensação mais nativa.
- Há menção de que o suporte a Windows pode ser possível com relativamente poucas mudanças de código.
Privacidade, segurança e uso corporativo
- Vários comentários alertam que enviar capturas de tela arbitrárias para uma nuvem de terceiros (OpenAI Vision API) é inaceitável em muitos ambientes corporativos ou regulados.
- Outros respondem que:
- Esse risco é semelhante ao de ferramentas de compartilhamento de tela baseadas na nuvem.
- Usuários que conseguem configurar chaves de API devem entender os riscos de dados fora do local e as políticas corporativas.
- A OpenAI afirma que os dados da API não são usados para treinamento, embora a confiança nessa afirmação seja debatida.
- Alguns projetos mencionados implementam remoção de PII como estratégia de mitigação.
Dependência da OpenAI vs modelos locais
- Vários comentadores não gostam da dependência da OpenAI e de modelos remotos de visão e querem:
- Uma versão totalmente local, offline, usando modelos abertos (por exemplo, LLaVA, Whisper, configurações multimodais locais).
- Uma API local compatível com a OpenAI, para que o app possa simplesmente apontar para
localhost.
- Observa-se que, como o projeto é de código aberto, as chamadas para a OpenAI podem, em princípio, ser trocadas por modelos auto-hospedados, embora isso não seja trivial para visão.
Recursos, UX e extensões
- Solicitações de recursos populares:
- Entrada/saída de texto em vez de, ou além de, voz (para ambientes silenciosos ou dispositivos sem microfones).
- Respostas de texto em streaming em vez de apenas TTS.
- Melhor comportamento da janela (auto-ocultar, configurabilidade).
- Estimadores de custo/prompt devido aos preços e limites da Vision API.
- O autor adiciona um modo de entrada de texto em resposta ao feedback.
- Ideias propostas, mas não (ainda) implementadas:
- Integração com as APIs de acessibilidade do macOS para ler texto ou executar ações.
- Permitir que o agente clique/digite e manipule a UI diretamente por meio de um driver.
- Prompts sensíveis ao contexto com base no app atual, histórico do terminal ou OCR.
- Usá-lo como modelo para assistentes de carro/do mundo real que combinem mapas, áudio e visão.
Comparações e ferramentas relacionadas
- Comentadores mencionam ferramentas semelhantes:
- Assistentes de IA em linha de comando para terminais.
- Assistentes locais de voz/visão.
- Clientes GPT para macOS e wrappers baseados na web.
- Alguns veem este projeto como um protótipo de copilotos em nível de sistema operacional que provavelmente serão lançados por grandes fornecedores no futuro.