语义检索与向量数据库选型:从 FAISS 到 Milvus 的落地对比
四、工程要点。 ① 维度一致性:embedding 模型与检索端必须用同一模型,否则向量不在同一语义空间,相似度毫无意义。维度通常 768(bge-base)或 1024(bge-large)。 ② 距离度量:余弦相似度最常用,需与训练时保持一致;内积(IP)在向量已归一化时等价于余弦。 ③ 混合检索:向量召回叠加 BM25 关键词,召回率通常优于单一向量检索;可给 BM25 0.3–0.5 的融合权重。 ④ 重排:召回 top-k(5–10)片段后,用 Cross-Encoder 重排器(如 bge-reranker-large)重新打分,取最相关 2–4 段送入生成模型,可显著提升答案准确度。 ⑤ 评估:用 Recall@k(前 k 个结果含正确答案的比例)衡量检索,用 Faithfulness/Answer Relevancy 衡量生成;可借助 RAGAS、TruLens 框架做自动化评测,定量看哪环掉链子。