检索增强生成(RAG)
从大语言模型的知识边界出发,讲清检索、切块、重排与评估的原理,回望 2026 年 RAG 的现实形态,最后动手构建一个属于自己的知识库问答系统。
Mav
01CH. 01
为什么需要 RAG:大语言模型的知识边界
从幻觉现象出发,分析参数化知识的三个结构性缺陷,引出检索增强生成的基本思想与完整流水线,并快速铺垫全书所需的背景知识。
开始阅读→
02CH. 02
检索:从关键词匹配到向量搜索
系统讲解 RAG 的检索层:词法检索的倒排索引与 BM25,语义检索的 embedding 与余弦相似度,近似最近邻索引与向量数据库的本质,以及混合检索与 RRF 融合。
开始阅读→
03CH. 03
切块与重排:决定检索质量的工程细节
深入 RAG 流水线中最不起眼却最关键的环节:切块策略及其失败模式、上下文增强技巧、bi-encoder 与 cross-encoder 的原理差异、两阶段检索架构,以及查询侧的改写技术。
开始阅读→
04CH. 04
RAG 系统的评估:指标、测试集与 LLM 裁判
把 RAG 调优从玄学变成科学:按检索与生成两段拆解失败模式,讲清 Recall@k、MRR 等检索指标与忠实度等生成指标,介绍 LLM-as-judge 方法及其偏差,以及如何构造自己的测试集。
开始阅读→
05CH. 05
2026 年的 RAG:Agentic 检索、GraphRAG 与长上下文之争
把镜头拉远看现实:从单轮 RAG 到模型自主驱动的 agentic 检索,编程助手为何用 grep 而不用向量库,GraphRAG 如何回答全局性问题,以及百万 token 上下文时代'RAG 已死'争论的完整分析。
开始阅读→
06CH. 06
实战:从零构建知识库问答系统
不用任何框架,用约两百行 Python 把前五章全部落地:读取并切块自己的 Markdown 资料库,调用 embedding API 建立向量索引,实现混合检索与带引用的生成,最后跑一遍自动化评估。
开始阅读→
07CH. 07
附录:工具生态速查与延伸阅读
正文刻意回避的工程生态一次讲清:向量数据库怎么选、LangChain 等框架的定位、embedding 模型选型要点,以及一份按阅读顺序编排的延伸阅读清单。
开始阅读→