在 RAG(检索增强生成)与 Agent 架构里,向量检索几乎成了所有“记忆”与“知识注入”环节的地基。但我在多个生产系统里反复看到同一个误区:团队把注意力全放在“哪个库跑分更高”上,却忽略了真正决定线上体验的,是索引结构、召回率与 QPS 之间的三角权衡,以及数据写入、压缩、过滤、版本治理这些看起来“不那么性感”的工程细节。
本文不打算罗列各家厂商的营销参数,而是从索引原理出发,讲清楚 HNSW 与 IVF 各自的适用边界,给出可复现的调优实验方法,最后落到一份可以直接照做的选型清单。
一、先厘清一个前提:向量检索的代价模型
2026/5/9大约 10 分钟