Show HN: Copiloto de IA de código abierto para macOS que usa visión y voz

Una app de “copiloto” de IA de código abierto para macOS que usa Electron, las APIs de visión y voz de OpenAI, y captura de pantalla para ayudar a los usuarios a interactuar con lo que aparece en su pantalla está generando tanto entusiasmo como escepticismo. Quienes la apoyan valoran su utilidad práctica para tareas como depuración, producción musical y aprendizaje de software complejo, y aprecian que sea fácil de extender o adaptar a modelos locales. Quienes la critican plantean preocupaciones sobre el rendimiento de Electron, la dependencia de la nube de OpenAI (coste, privacidad y políticas corporativas) y la falta de entrada solo por texto, lo que ha llevado a sugerir implementaciones nativas en Swift, modelos multimodales locales y una integración más estrecha con el sistema operativo.

Recepción general

  • Muchos comentaristas encuentran la app “muy interesante” y un buen MVP al estilo “Show HN”, especialmente para aprender software complejo más rápido (por ejemplo, Ableton Live).
  • Otros son escépticos sobre su utilidad real y señalan que algunas demos parecen genéricas y al estilo de Eliza, con respuestas lentas y una comprensión aparente limitada del contenido.
  • Varios elogian el concepto de “LLM como interfaz” y prevén que los asistentes de voz/visión se volverán normales en todos los dispositivos y sistemas operativos.

Pila tecnológica (Electron frente a nativo)

  • Algunos critican el uso de Electron para una herramienta específica de macOS, citando preocupaciones de rendimiento e integración con el sistema operativo.
  • Otros argumentan que Electron es una elección pragmática para un primer proyecto y para MVP rápidos; la elección de la pila se presenta como secundaria frente a lanzar y aprender.
  • Entre las sugerencias figuran Swift/SwiftUI, AppKit, o alternativas como Tauri para aplicaciones más pequeñas y con una sensación más nativa.
  • Se menciona que el soporte para Windows podría ser posible con relativamente pocos cambios de código.

Privacidad, seguridad y uso corporativo

  • Varios comentarios advierten que enviar capturas de pantalla arbitrarias a una nube de terceros (OpenAI Vision API) es inaceptable en muchos entornos corporativos o regulados.
  • Otros responden que:
    • Este riesgo es similar al de las herramientas de compartición de pantalla basadas en la nube.
    • Los usuarios que pueden configurar claves de API deberían entender los riesgos de datos fuera del sitio y las políticas corporativas.
    • OpenAI afirma que los datos de la API no se usan para entrenamiento, aunque se debate la confianza en esa afirmación.
  • Algunos proyectos mencionados implementan eliminación de PII como estrategia de mitigación.

Dependencia de OpenAI frente a modelos locales

  • Varios comentaristas no gustan de depender de OpenAI y de modelos de visión remotos y quieren:
    • Una versión totalmente local y sin conexión usando modelos abiertos (por ejemplo, LLaVA, Whisper, configuraciones multimodales locales).
    • Una API local compatible con OpenAI, para que la app pueda apuntar simplemente a localhost.
  • Se señala que, como el proyecto es de código abierto, las llamadas a OpenAI en principio pueden sustituirse por modelos autoalojados, aunque esto no es trivial para visión.

Funciones, UX y extensiones

  • Peticiones de funciones populares:
    • Entrada/salida de texto en lugar de, o además de, voz (para entornos silenciosos o dispositivos sin micrófono).
    • Respuestas de texto en streaming en lugar de solo TTS.
    • Mejor comportamiento de las ventanas (ocultación automática, configurabilidad).
    • Estimadores de coste/prompt debido a los precios y límites de tasa de Vision API.
  • El autor añade un modo de entrada de texto en respuesta a los comentarios.
  • Ideas propuestas pero no implementadas todavía:
    • Integración con las APIs de accesibilidad de macOS para leer texto o realizar acciones.
    • Permitir que el agente haga clic/escriba y manipule la interfaz directamente mediante un controlador.
    • Prompts sensibles al contexto basados en la app actual, el historial del terminal o OCR.
    • Usarlo como modelo para asistentes de coche/mundo real que combinen mapas, audio y visión.

Comparaciones y herramientas relacionadas

  • Los comentaristas mencionan herramientas similares:
    • Asistentes de IA de línea de comandos para terminales.
    • Asistentes locales de voz/visión.
    • Clientes GPT para macOS y envoltorios basados en web.
  • Algunos ven este proyecto como un prototipo de copilotos a nivel de sistema operativo que probablemente serán lanzados por grandes proveedores en el futuro.