我们是否已经到了向量数据库的巅峰?
在 AI 生成 embedding 的存储与检索工具热潮中,许多工程师质疑专用“向量数据库”对大多数真实场景是否有些大材小用,因为数据量通常不大,而在内存中进行暴力搜索或使用 PostgreSQL 扩展如 pgvector 往往就足够。评论者认为,余弦相似度搜索只是数据库最终很可能吸收的一项特性,而更难、更有价值的问题在于模型微调、词法-向量混合检索,以及重新生成 embedding 和扩展等运维问题。大家普遍对大量向量数据库初创公司的长期前景持怀疑态度,同时也认同向量搜索本身仍然重要,但还不是一项完全“解决了”的技术。
向量数据库的范围与需求
- 许多人认为,大多数当前的 RAG 和“copilot”用例规模都足够小,在内存中的向量上进行暴力搜索(NumPy、PyTorch、Pandas、Parquet+FAISS)在约 10 万到 100 万行以内已经足够,有时甚至更多。
- 只有在更大规模(数百万到数十亿个向量)、严格的延迟/QPS 要求,或数据无法装入 RAM 时,向量数据库才变得有吸引力。
- 有几位指出,计算 embedding(尤其是基于 LLM 的模型)比余弦相似度贵好几个数量级,因此在早期阶段,检索很少是主要瓶颈。
- 也有人反驳称,这低估了重复查询、索引成本,以及在存储大量向量时的内存压力。
Postgres、扩展,以及“特性而非产品”的观点
- 普遍认为,向量搜索是一项“特性”,最终会被主流数据库(Postgres、MySQL 等)吸收,就像 JSON、OLAP、图数据库和文档存储那样。
- pgvector(以及 Lantern、SQLite VSS 等类似扩展)被视为对许多生产系统“足够好”,可支持到数百万文档,且最近还有多线程索引构建等改进。
- 一些人认为,专用向量数据库缺乏持久护城河,随着传统 RDBMS 扩展向量能力和混合搜索,它们很可能被取代。
算法与研究层面的局限
- ANN / 向量索引被描述为仍处于开放研究领域,且权衡并不令人满意;与 B 树不同,当前方法是近似的,并且在高维空间中很脆弱。
- 最大内积搜索被强调为比标准 ANN 还更困难,因为可利用的几何结构更差,而且查询与索引分布不同。
- 讨论还涉及高维中的余弦距离与欧几里得距离,以及 embedding 作为有损压缩 / 感知哈希时的行为。
超越“余弦相似度即服务”
- 有人认为“余弦相似度搜索即服务”已经商品化或被过度炒作;更难也更有价值的工作在于:
- 针对领域特定查询微调 embedding 模型。
- 管理 embedding 生命周期:当模型变化时重新生成 embedding、存储与重算。
- 混合检索:结合词法(BM25)、元数据过滤和向量,并进行排序。
- 为 RAG 做预处理:分块、添加推断事实或 QA 对,使用 LLM 在 embedding 之前丰富文档。
市场炒作与未来方向
- 对于我们是否已经到了“向量数据库巅峰”或仍处于早期淘金热阶段,意见不一。
- 许多人预计会出现整合:LLM 平台和数据库内部提供向量能力,以及少数更高层的“面向 RAG 的 Algolia”式服务,隐藏分块和索引复杂性。
- 端侧 / 边缘向量搜索(例如用于私有照片搜索)被认为是一个新兴但仍未被充分满足的领域。