Show HN: Copiloto de IA de código abierto para macOS que usa visión y voz
Una app de “copiloto” de IA de código abierto para macOS que usa Electron, las APIs de visión y voz de OpenAI, y captura de pantalla para ayudar a los usuarios a interactuar con lo que aparece en su pantalla está generando tanto entusiasmo como escepticismo. Quienes la apoyan valoran su utilidad práctica para tareas como depuración, producción musical y aprendizaje de software complejo, y aprecian que sea fácil de extender o adaptar a modelos locales. Quienes la critican plantean preocupaciones sobre el rendimiento de Electron, la dependencia de la nube de OpenAI (coste, privacidad y políticas corporativas) y la falta de entrada solo por texto, lo que ha llevado a sugerir implementaciones nativas en Swift, modelos multimodales locales y una integración más estrecha con el sistema operativo.
Recepción general
- Muchos comentaristas encuentran la app “muy interesante” y un buen MVP al estilo “Show HN”, especialmente para aprender software complejo más rápido (por ejemplo, Ableton Live).
- Otros son escépticos sobre su utilidad real y señalan que algunas demos parecen genéricas y al estilo de Eliza, con respuestas lentas y una comprensión aparente limitada del contenido.
- Varios elogian el concepto de “LLM como interfaz” y prevén que los asistentes de voz/visión se volverán normales en todos los dispositivos y sistemas operativos.
Pila tecnológica (Electron frente a nativo)
- Algunos critican el uso de Electron para una herramienta específica de macOS, citando preocupaciones de rendimiento e integración con el sistema operativo.
- Otros argumentan que Electron es una elección pragmática para un primer proyecto y para MVP rápidos; la elección de la pila se presenta como secundaria frente a lanzar y aprender.
- Entre las sugerencias figuran Swift/SwiftUI, AppKit, o alternativas como Tauri para aplicaciones más pequeñas y con una sensación más nativa.
- Se menciona que el soporte para Windows podría ser posible con relativamente pocos cambios de código.
Privacidad, seguridad y uso corporativo
- Varios comentarios advierten que enviar capturas de pantalla arbitrarias a una nube de terceros (OpenAI Vision API) es inaceptable en muchos entornos corporativos o regulados.
- Otros responden que:
- Este riesgo es similar al de las herramientas de compartición de pantalla basadas en la nube.
- Los usuarios que pueden configurar claves de API deberían entender los riesgos de datos fuera del sitio y las políticas corporativas.
- OpenAI afirma que los datos de la API no se usan para entrenamiento, aunque se debate la confianza en esa afirmación.
- Algunos proyectos mencionados implementan eliminación de PII como estrategia de mitigación.
Dependencia de OpenAI frente a modelos locales
- Varios comentaristas no gustan de depender de OpenAI y de modelos de visión remotos y quieren:
- Una versión totalmente local y sin conexión usando modelos abiertos (por ejemplo, LLaVA, Whisper, configuraciones multimodales locales).
- Una API local compatible con OpenAI, para que la app pueda apuntar simplemente a
localhost.
- Se señala que, como el proyecto es de código abierto, las llamadas a OpenAI en principio pueden sustituirse por modelos autoalojados, aunque esto no es trivial para visión.
Funciones, UX y extensiones
- Peticiones de funciones populares:
- Entrada/salida de texto en lugar de, o además de, voz (para entornos silenciosos o dispositivos sin micrófono).
- Respuestas de texto en streaming en lugar de solo TTS.
- Mejor comportamiento de las ventanas (ocultación automática, configurabilidad).
- Estimadores de coste/prompt debido a los precios y límites de tasa de Vision API.
- El autor añade un modo de entrada de texto en respuesta a los comentarios.
- Ideas propuestas pero no implementadas todavía:
- Integración con las APIs de accesibilidad de macOS para leer texto o realizar acciones.
- Permitir que el agente haga clic/escriba y manipule la interfaz directamente mediante un controlador.
- Prompts sensibles al contexto basados en la app actual, el historial del terminal o OCR.
- Usarlo como modelo para asistentes de coche/mundo real que combinen mapas, audio y visión.
Comparaciones y herramientas relacionadas
- Los comentaristas mencionan herramientas similares:
- Asistentes de IA de línea de comandos para terminales.
- Asistentes locales de voz/visión.
- Clientes GPT para macOS y envoltorios basados en web.
- Algunos ven este proyecto como un prototipo de copilotos a nivel de sistema operativo que probablemente serán lanzados por grandes proveedores en el futuro.