启动 HN:Danswer(YC W24)——面向私有数据的开源 AI 搜索与聊天

一个名为 Danswer 的开源项目旨在为公司私有知识提供 AI 驱动的搜索与聊天,聚合来自 Slack、Google Drive、Confluence、GitHub 等工具的内容。评论者追问它如何处理检索质量、访问控制、多语言支持以及在大规模下的增量同步,并将其与自建 RAG 原型以及 Microsoft Copilot、Glean 等商业产品进行对比。创始人将开源、自托管、可扩展连接器以及对检索质量的重视定位为主要优势,同时通过付费云版本和高级企业功能变现。

产品定位与差异化

  • 定位为面向团队的开源“统一搜索 + AI 聊天”,用于私有公司数据,而不只是一个类似 ChatGPT 的界面。
  • 强调 RAG 的检索部分:连接 Notion、Confluence、Jira、Slack、Google Drive、GitHub/GitLab 等工具,支持增量更新、元数据和访问控制。
  • 与替代方案(OpenWebUI、Glean、dust、Vectara、privateGPT、Copilot)相比,Danswer 强调开源、自托管、强检索和多来源聚合;其他方案被认为更偏专有、更窄,或更偏“助手/代理”。

开源、商业模式与护城河

  • 核心采用 MIT 许可;付费云版本和一些高级企业功能(如 SAML/OIDC、专家查找、高级 RBAC)是专有的。
  • 策略是赢得被高接触式 SaaS 供应商忽视的小型和中型团队,并吸引希望透明度、可定制性和自托管的大型组织。
  • 也承认来自 FAANG/Copilot 的竞争,但创始人认为 OSS + 社区 + 灵活性是一条可 دفاع 的路径。

架构、模型与检索质量

  • 使用 Vespa 作为向量数据库 + 搜索引擎;混合搜索(关键词 + embeddings),在 CPU 上运行约 1 亿参数的本地模型用于 embeddings/reranker,默认使用 OpenAI LLM,但可插拔/开权重模型(包括通过 Ollama)。
  • RAG 流水线包括上下文感知分块(有限使用 LlamaIndex)、多粒度检索过程、基于反馈的重排序以及基于时间的衰减。
  • 新颖的 reranking 方法:用 LLM 判断分块是否“有用”,而不只是“相关”,声称比标准 cross-encoder 能获得更好的结果。

安全、隐私与访问控制

  • 提供多种认证方式(basic、Google OAuth;付费层支持 OIDC/SAML)。支持仅限特定域名的注册。
  • RBAC 目前粒度到连接器级别;正在推进从来源系统同步更细粒度权限(Google Drive、Confluence、Jira、Notion、Slack 频道成员关系)。
  • 对于 SaaS,管理员可在协议下访问数据;对于自托管,基础设施管理员通常本来就能访问源系统。也支持使用本地 LLM 的 air-gapped 部署。

限制、路线图与使用场景

  • 当前缺口:尚不支持完整代码搜索(目前仅支持 PR 和 issue),电子表格和 PDF 处理较基础,没有 OCR 或对表格/图表的丰富理解;这些都在路线图上。
  • 实时/流式采集已部分搭建,但由于源 API 限制,目前大多未启用。
  • 来自那些内部搜索很痛苦的团队,尤其是咨询、企业和政府客户,反馈强烈且积极;但也有人对 LLM 推理深度、私有频道的 UX,以及长上下文知识探索表示怀疑。