图片

大模型不是全知全能。它不知道你公司的合同细则、上个月那张业务报表、团队 Notion 里写的复盘。要让 Agent 答得准、不胡编,得给它一套「外部知识系统」——这就是 RAG。今天我们把 RAG 拆开讲透:它为什么是 Agent 的知识底座。

一、RAG 的完整链路

RAG 的全称是「检索增强生成」。名字很学术,本质一句话:先把知识存好,问答时再按需取用,喂给模型一起生成答案。它是一条固定的流水线,六步走:

图片

Document(文档):先把 PDF、网页、表格这些原始材料收集进来。

Chunk(切块):把长文档切成一个个知识小块,方便精确检索。

Embedding(向量化):每块转成一串向量数字,让机器能算「意思多接近」。

Index(建索引):把这些向量存进向量数据库,建好索引,查起来飞快。

Retrieve(检索):用户一提问,就从库里捞出最相关的那几块。

Generate(生成):把捞出来的上下文 + 问题一起喂给模型,生成带依据的答案。

📌 记住:RAG 把「模型记忆」和「外部知识」拆开了。模型负责聪明地组织语言,知识库负责提供事实。两者配合,才不会一本正经地胡说。

二、Chunking 切块策略

切块是 RAG 质量的第一道关。切得不好,后面检索再强也白搭。三种常见切法:

图片

| 切法

|

做法

|

适合场景

固定切块

|

按固定字数一刀切

|

格式规整、不在乎语义断点

| |

语义切块

|

按语义边界自然断句

|

回答要保住完整意思

| |

Parent-Child

|

小块管检索、大块管上下文

|

生产环境首选

|

生产上最常用的是Parent-Child(父子块):先用小块精准定位到相关片段,再把整段父块喂给模型——既找得准,又看得全。

三、Hybrid Search 混合检索

光靠向量检索还不够稳。两套检索一起跑,结果再合并,叫「混合检索」:

图片

向量检索:按「意思相近」找,同义词、换个说法也能命中,擅长模糊语义。

BM25 关键词:按「词频命中」找,专有名词、编号、术语超准,但不懂同义。

📌 向量管「像不像」、BM25 管「是不是」。两者互补,召回率明显比单用一种更高。

四、Rerank 为什么必须重排序

很多人以为「检索出来」就完事了,其实还差关键一步——重排序。

图片

检索阶段为了「召回全」,会带一堆沾边但不对的块。这些噪声直接喂给模型,会带偏答案、把真正关键的证据挤掉。Rerank 用一个更强的模型,两两比对「哪块更相关」,把真正有用的排到最前,只留 Top-K 喂给模型。这一步做不做,RAG 效果差一大截。

五、Graph RAG 知识图谱增强

普通 RAG 只认「字面相似」的块,看不出实体之间的关系。问「谁和谁有什么关系」,它就抓瞎。Graph RAG 来补这个短板:

图片

它先把文档里的实体和关系抽出来,建成一张知识图谱,检索时沿着图「走邻居」。答案不再是零散片段,而是有结构、有来龙去脉。适合强关联的知识域:企业组织、供应链、法规条款之间的勾稽关系。

六、Agentic RAG 让检索也交给 Agent

传统 RAG 是「问一次、查一次」,流程定死。Agentic RAG 更进一步——让 Agent 自己决定怎么查:

图片

先拆解问题要查哪几面;

一次不够,就换关键词再查;

查到矛盾,就追第二轮;

查完自己评估「够不够」,不够就继续。

好处是多跳问题答得动、证据更全、幻觉更少;代价是多花点步数和 Token。把「检索」也从死流程变成了 Agent 的判断环节。

七、长上下文陷阱:Lost in the Middle

一个反直觉的坑:上下文越长,模型越「看两头、忘中间」。关键信息若夹在一大段中间,模型常常忽略它。

图片

📌 对策:靠 Rerank 把关键块顶到上下文的「开头」或「结尾」,别让真正的证据沉在中间被模型忘记。

八、本节实战:企业知识库 Agent

把前面所有拼起来,做一个能服务全公司的「企业知识库 Agent」:

图片

把四类来源统一接进同一套 RAG 流水线:

PDF:合同、手册、年度报告;

网页:官网、舆情、外部文档站;

Notion:团队内部沉淀的复盘与知识;

SQL:业务库里实时跑出来的真实数据。

统一进向量库之后,员工一句话就能问到全公司的知识——「上季度华东区退货率为什么涨了?」这种跨源问题,它也能把 PDF 政策、SQL 数据、Notion 复盘串起来答。

本课重点回顾

第8课要点回顾

日拱一卒,功不唐捐,和各位一起在 AI 时代无限进步。