附录:工具生态速查与延伸阅读
A.1 向量数据库:什么时候才真的需要
第 2 章和第 6 章反复演示了"numpy 就够",这里把升级的判断标准和选型图谱补全。触发升级的信号(满足任意一条再考虑,否则继续用 .npy):向量数量到了百万级、内存开始装不下;需要频繁增删改(numpy 方案改一条要重写整个文件);多进程/多用户并发访问;需要元数据过滤与向量检索深度结合("只在标签为 X 且日期晚于 Y 的块里找")。
到了那一步,2026 年的主要选项按形态分三类:
| 类型 | 代表 | 适合 |
|---|---|---|
| 嵌入式库(进程内,无服务) | FAISS、Chroma、LanceDB | 单机应用、原型;FAISS 是 ANN 算法的事实标准库 |
| 独立服务(自部署) | Qdrant、Milvus、Weaviate | 生产环境、需要水平扩展 |
| 托管云服务 | Pinecone、各大云厂商的向量服务 | 不想运维;按量付费 |
| 现有数据库的向量扩展 | pgvector(PostgreSQL)、Redis、Elasticsearch | 已经在用这些数据库时的首选——少一个组件永远是好架构 |
最后一行值得展开一句:如果你的系统里已经有 PostgreSQL,pgvector 几乎总是比引入一个专门的向量数据库更明智——向量和业务数据同库、同事务、同备份,运维成本近乎为零。"专用向量数据库 vs 现有数据库加扩展"是 2024 年后生态里真实发生的路线竞争,目前后者在中小规模场景明显占了上风。
A.2 框架:LangChain、LlamaIndex 与"不用框架"
正文通篇没用框架,附录把话说完整。LangChain 是 LLM 应用的通用编排框架,RAG 只是它的一个子场景;LlamaIndex 则以数据接入和索引为核心,天生更贴 RAG,内置了正文讲过的大部分技巧(small-to-big、多种切块器、评估模块)的现成实现;Haystack 在传统 IR 团队里口碑较好。
用不用框架的判断,和"用不用向量数据库"同构:框架解决的是集成的广度,不是检索的质量。它们的价值在连接器多(一百种数据源、一百种向量库开箱即用)、原型快;代价是抽象层厚,出了问题要隔着几层包装去排查,而 RAG 调优恰恰是不断拆开细节看的过程。所以合理的路径是:学习和调优期用裸代码(正文的做法——两百行本来也不多),集成期按需上框架,且始终确保你知道每层抽象下面发生了什么。反过来"先用框架搭起来再说"的路径,常见结局是系统能跑但效果平庸,且没人说得清瓶颈在哪一环。
A.3 Embedding 模型选型
几个真正影响决策的维度,按重要性排:
中文/多语言质量。 各家模型在英文基准上的差距远小于在中文上的差距。选型前务必在自己的语料上跑第 4 章的 Recall 评估——榜单(MTEB 等公开基准)只能划定候选范围,不能代替实测,况且榜单存在被"应试训练"污染的老问题。
商用 API 还是开源自部署。 API(Voyage、OpenAI、Cohere 等)免运维、质量稳定,代价是数据出境到服务商和按量付费;开源模型(BGE、GTE、Qwen-embedding 等系列)数据不出门、量大时更便宜,代价是要自己管 GPU 推理。个人与原型选 API,数据敏感或超大规模选自部署,是常规判断。
维度与存储。 维度大多在 512~4096 之间,维度翻倍意味着存储和检索计算翻倍,而质量收益通常远小于线性。部分模型支持"套娃表示学习"(Matryoshka),同一向量可按需截断使用——大库存储紧张时是实用特性。
一条铁律。 换 embedding 模型 = 全库重新向量化:不同模型的向量空间互不兼容,哪怕维度相同也不能混用。所以选型宜早不宜迟,中途更换的成本是完整重建一遍索引。
A.4 延伸阅读
按"接着本书往下读"的顺序编排,而非按发表时间:
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, 2020. RAG 的命名之作。今天读它的价值主要是历史性的——看看"检索器与生成器联合训练"的原始形态,对比第 5 章讲的松耦合现状,能真切感到这个领域五年里换了人间。
- Liu et al., Lost in the Middle: How Language Models Use Long Contexts, 2023. 第 1 章"大海捞针"讨论的出处,实验设计干净利落,值得作为"如何做扎实的 LLM 行为实验"的范文来读。
- Robertson & Zaragoza, The Probabilistic Relevance Framework: BM25 and Beyond, 2009. BM25 作者亲撰的综述。第 2 章只给了公式和直觉,这里有完整的概率推导——词法检索五十年功力的浓缩。
- Gao et al., Precise Zero-Shot Dense Retrieval without Relevance Labels, 2022. HyDE 的原论文,第 3 章"用幻觉治幻觉"的出处,短小精悍。
- Anthropic, Introducing Contextual Retrieval, 2024(技术博客). 第 3 章上下文增强一节的主要参考,附有不同语料规模下的消融数据,工程参考价值高于多数论文。
- Edge et al., From Local to Global: A Graph RAG Approach to Query-Focused Summarization, 2024. GraphRAG 原论文,第 5 章全局性问题的完整方案,微软已开源配套实现。
- RAGAS 文档与论文(RAGAS: Automated Evaluation of Retrieval Augmented Generation, 2023). 第 4 章那套指标(忠实度、答案相关性等)的自动化实现,可以直接接到第 6 章的实战代码后面用。
读完这一份清单,你对 RAG 的理解就完成了从"读过一本科普"到"摸到研究与工程前沿"的换挡。剩下的部分——也是最重要的部分——是回到第 6 章那两百行代码,用你自己的数据把每一个想法试一遍。开卷考试的要义,终究是要亲手翻书。