Lanzamiento HN: Danswer (YC W24) – Búsqueda y chat con IA de código abierto sobre datos privados

Un proyecto de código abierto llamado Danswer busca ofrecer búsqueda y chat impulsados por IA sobre el conocimiento privado de una empresa, agregando contenido de herramientas como Slack, Google Drive, Confluence, GitHub y más. Los comentaristas analizan cómo maneja la calidad de la recuperación, el control de acceso, el soporte multilingüe y la sincronización incremental a escala, y lo contrastan tanto con prototipos internos de RAG como con ofertas comerciales como Microsoft Copilot o Glean. Los fundadores presentan la apertura, el autoalojamiento, los conectores extensibles y el enfoque en la calidad de la recuperación como su principal ventaja, mientras monetizan mediante una versión cloud de pago y funciones empresariales avanzadas.

Enfoque del producto y diferenciación

  • Posicionado como una solución de código abierto, orientada a equipos, de “búsqueda unificada + chat con IA” sobre datos privados de la empresa, no solo como una interfaz tipo ChatGPT.
  • Énfasis en la mitad de recuperación de RAG: conectores a herramientas como Notion, Confluence, Jira, Slack, Google Drive, GitHub/GitLab, etc., actualizaciones incrementales, metadatos y control de acceso.
  • Comparado con alternativas (OpenWebUI, Glean, dust, Vectara, privateGPT, Copilot): Danswer enfatiza el código abierto, el autoalojamiento, la recuperación sólida y la agregación de múltiples fuentes; se ve a las otras como más propietarias, más estrechas o más orientadas a “asistente/agente”.

Código abierto, modelo de negocio y foso

  • El núcleo tiene licencia MIT; la nube de pago y algunas funciones empresariales avanzadas (por ejemplo, SAML/OIDC, búsqueda de expertos, RBAC avanzado) son propietarias.
  • Estrategia: captar equipos pequeños y medianos que los proveedores SaaS de alto contacto ignoran, y atraer a grandes organizaciones que quieren transparencia, personalización y autoalojamiento.
  • Se reconoce la competencia de FAANG/Copilot, pero los fundadores creen que OSS + comunidad + flexibilidad es un ángulo defendible.

Arquitectura, modelos y calidad de la recuperación

  • Usa Vespa como base de datos vectorial + motor de búsqueda; búsqueda híbrida (palabras clave + embeddings), modelos locales de ~100M de parámetros en CPU para embeddings/rerankers, LLM predeterminado de OpenAI pero modelos enchufables/de pesos abiertos (incluido mediante Ollama).
  • El flujo RAG incluye fragmentación sensible al contexto (mediante un uso limitado de LlamaIndex), pases de múltiples granularidades, reordenación basada en feedback y decaimiento basado en el tiempo.
  • Enfoque novedoso de reranking: usar un LLM para juzgar si los fragmentos son “útiles”, no solo “relevantes”, afirmando mejores resultados que los cross-encoders estándar.

Seguridad, privacidad y control de acceso

  • Múltiples opciones de autenticación (básica, Google OAuth; OIDC/SAML en el plan de pago). Se admiten registros restringidos por dominio.
  • El RBAC actualmente es a nivel de conector; hay trabajo en curso para sincronizar permisos granulares desde las fuentes (Google Drive, Confluence, Jira, Notion, membresía de canales de Slack).
  • Para SaaS, los administradores pueden acceder a los datos bajo acuerdo; para autoalojado, los administradores de infraestructura normalmente ya tienen acceso a los sistemas de origen. Son posibles configuraciones aisladas de la red con LLM locales.

Limitaciones, hoja de ruta y casos de uso

  • Carencias actuales: todavía no hay búsqueda completa de código (solo PRs/issues), manejo básico de hojas de cálculo y PDFs, sin OCR ni comprensión rica de tablas/gráficos; todo eso está en la hoja de ruta.
  • La ingesta en tiempo real/streaming está parcialmente preparada, pero en su mayor parte no se usa debido a límites de las APIs de las fuentes.
  • Fuerte interés y comentarios positivos de equipos con búsqueda interna dolorosa, especialmente consultoría y empresas/gobierno; hay cierto escepticismo sobre la profundidad del razonamiento de los LLM, la UX en torno a canales privados y la exploración de conocimiento de contexto largo.