RAG文档处理与切分策略:6种分块方式对比,80_的检索问题从这里解决
上一篇我说过,80%的RAG项目问题出在检索和文档处理,而其中又有40%直接出在切分环节。你可能不信——切分不就是按字符数切嘛,能有多大事?
我之前帮一个团队做法律知识库,他们用的固定512字符切分,结果一份合同里的"甲方权利"和"甲方义务"被切到了两个chunk里。用户问"甲方有什么权利",检索到的是"义务"那段,模型回答完全跑偏。切分不对,检索再准也没用——因为你存进去的东西就是残缺的。
今天这篇专门讲文档处理和切分,从PDF解析到6种切分策略,我把踩过的坑全掏出来。
先说PDF解析:你以为的文本提取可能是错的
如果你的知识库主要是PDF文档,先别急着切分——PDF解析本身就是个大坑。
常见问题
-
表格丢失:很多PDF解析器把表格变成一行行文本,列关系全没了
-
多栏排版混乱:学术论文的双栏排版,解析后左右两栏的文字交叉在一起
-
图片中的文字:扫描件PDF,文字是图片不是文本,普通解析器提取不了
-
页眉页脚混入正文:页码、章节标题等噪音被当作正文处理
解析工具选型
| 工具
|
特点
|
适用场景
PyPDFLoader
|
简单快速,纯文本PDF
|
结构简单的文档
| |
PyMuPDFLoader
|
保留更多格式信息
|
带表格、图片的PDF
| |
UnstructuredLoader
|
支持复杂布局、表格识别
|
复杂排版文档
| |
marker
|
开源OCR+布局识别
|
扫描件PDF
| |
docling
|
IBM开源,多格式支持
|
企业级文档处理
|
<span><span leaf=""># 简单PDF</span></span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_community.document_loaders </span><span><span leaf="">import</span></span><span leaf=""> PyPDFLoader</span><span leaf=""><br></span><span leaf="">loader = PyPDFLoader(</span><span><span leaf="">"contract.pdf"</span></span><span leaf="">)</span><span leaf=""><br></span><span leaf="">docs = loader.load()</span><span leaf=""><br></span><span leaf=""><br></span><span><span leaf=""># 复杂PDF(带表格、多栏)</span></span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_community.document_loaders </span><span><span leaf="">import</span></span><span leaf=""> UnstructuredLoader</span><span leaf=""><br></span><span leaf="">loader = UnstructuredLoader(</span><span><span leaf="">"report.pdf"</span></span><span leaf="">, mode=</span><span><span leaf="">"elements"</span></span><span leaf="">)</span><span leaf=""><br></span><span leaf="">docs = loader.load()</span><span leaf=""><br></span><span><span leaf=""># Unstructured会自动识别表格、标题、列表等元素</span></span><span leaf=""><br></span>
我的建议:别在PDF解析上省钱。解析质量直接决定后续所有环节的天花板。如果你的PDF很复杂(表格多、排版乱),用Unstructured或docling;简单的用PyMuPDFLoader就行。
6种切分策略:从粗暴到精细
策略1:固定长度切分(最基础)
按字符数或Token数切,最简单但问题最多:
<span><span leaf="">from</span></span><span leaf=""> langchain_text_splitters </span><span><span leaf="">import</span></span><span leaf=""> CharacterTextSplitter</span><span leaf=""><br></span><span leaf=""><br></span><span leaf="">splitter = CharacterTextSplitter(</span><span leaf=""><br></span><span leaf=""> chunk_size=</span><span><span leaf="">500</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> chunk_overlap=</span><span><span leaf="">50</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> separator=</span><span><span leaf="">"\n\n"</span></span><span leaf="">, </span><span><span leaf=""># 优先在段落处切</span></span><span leaf=""><br></span><span leaf="">)</span><span leaf=""><br></span><span leaf="">chunks = splitter.split_documents(docs)</span><span leaf=""><br></span>
问题:可能在句子中间切断,破坏语义。适合对精度要求不高的场景。
策略2:递归字符切分(最常用)
LangChain的RecursiveCharacterTextSplitter,按优先级尝试不同的分隔符:
<span><span leaf="">from</span></span><span leaf=""> langchain_text_splitters </span><span><span leaf="">import</span></span><span leaf=""> RecursiveCharacterTextSplitter</span><span leaf=""><br></span><span leaf=""><br></span><span leaf="">splitter = RecursiveCharacterTextSplitter(</span><span leaf=""><br></span><span leaf=""> chunk_size=</span><span><span leaf="">500</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> chunk_overlap=</span><span><span leaf="">50</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> separators=[</span><span><span leaf="">"\n\n"</span></span><span leaf="">, </span><span><span leaf="">"\n"</span></span><span leaf="">, </span><span><span leaf="">"。"</span></span><span leaf="">, </span><span><span leaf="">"!"</span></span><span leaf="">, </span><span><span leaf="">"?"</span></span><span leaf="">, </span><span><span leaf="">","</span></span><span leaf="">, </span><span><span leaf="">" "</span></span><span leaf="">, </span><span><span leaf="">""</span></span><span leaf="">],</span><span leaf=""><br></span><span leaf="">)</span><span leaf=""><br></span><span leaf="">chunks = splitter.split_documents(docs)</span><span leaf=""><br></span>
优先在段落→换行→句子→逗号→空格处切,实在不行才在字符中间切。这是大部分项目的默认选择,够用了。
策略3:语义切分(更精准)
根据语义相似度来决定切分点——如果相邻两句话的语义差异很大,就在那里切:
<span><span leaf="">from</span></span><span leaf=""> langchain_experimental.text_splitter </span><span><span leaf="">import</span></span><span leaf=""> SemanticChunker</span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_openai </span><span><span leaf="">import</span></span><span leaf=""> OpenAIEmbeddings</span><span leaf=""><br></span><span leaf=""><br></span><span leaf="">splitter = SemanticChunker(</span><span leaf=""><br></span><span leaf=""> OpenAIEmbeddings(),</span><span leaf=""><br></span><span leaf=""> breakpoint_threshold_type=</span><span><span leaf="">"percentile"</span></span><span leaf="">, </span><span><span leaf=""># 用百分位数判断语义断点</span></span><span leaf=""><br></span><span leaf=""> breakpoint_threshold_amount=</span><span><span leaf="">75</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf="">)</span><span leaf=""><br></span><span leaf="">chunks = splitter.split_documents(docs)</span><span leaf=""><br></span>
优点:每个chunk内的语义是连贯的。缺点:慢(要算Embedding),贵(每次切分都调API)。
适合对检索精度要求高、文档量不太大的场景。
策略4:按文档结构切分(最推荐)
利用文档本身的标题、章节、段落结构来切分:
<span><span leaf="">from</span></span><span leaf=""> langchain_text_splitters </span><span><span leaf="">import</span></span><span leaf=""> MarkdownHeaderTextSplitter</span><span leaf=""><br></span><span leaf=""><br></span><span><span leaf=""># Markdown文档:按标题层级切分</span></span><span leaf=""><br></span><span leaf="">headers_to_split_on = [</span><span leaf=""><br></span><span leaf=""> (</span><span><span leaf="">"#"</span></span><span leaf="">, </span><span><span leaf="">"Header 1"</span></span><span leaf="">),</span><span leaf=""><br></span><span leaf=""> (</span><span><span leaf="">"##"</span></span><span leaf="">, </span><span><span leaf="">"Header 2"</span></span><span leaf="">),</span><span leaf=""><br></span><span leaf=""> (</span><span><span leaf="">"###"</span></span><span leaf="">, </span><span><span leaf="">"Header 3"</span></span><span leaf="">),</span><span leaf=""><br></span><span leaf="">]</span><span leaf=""><br></span><span leaf="">splitter = MarkdownHeaderTextSplitter(headers_to_split_on=headers_to_split_on)</span><span leaf=""><br></span><span leaf="">chunks = splitter.split_text(markdown_text)</span><span leaf=""><br></span><span><span leaf=""># 每个chunk会自动携带标题元数据</span></span><span leaf=""><br></span>
<span><span leaf=""># HTML文档:按标签切分</span></span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_text_splitters </span><span><span leaf="">import</span></span><span leaf=""> HTMLSectionSplitter</span><span leaf=""><br></span><span leaf="">sections_to_split_on = [(</span><span><span leaf="">"h1"</span></span><span leaf="">, </span><span><span leaf="">"Header 1"</span></span><span leaf="">), (</span><span><span leaf="">"h2"</span></span><span leaf="">, </span><span><span leaf="">"Header 2"</span></span><span leaf="">)]</span><span leaf=""><br></span><span leaf="">splitter = HTMLSectionSplitter(sections_to_split_on=sections_to_split_on)</span><span leaf=""><br></span>
这种方式最推荐,因为文档的标题层级天然就是语义划分。切出来的chunk语义完整,元数据也保留了,后续检索时可以用元数据做过滤。
策略5:父文档检索切分(大小块配合)
存两种粒度的chunk:小块用于精确检索,大块用于返回给模型:
<span><span leaf="">from</span></span><span leaf=""> langchain.retrievers </span><span><span leaf="">import</span></span><span leaf=""> ParentDocumentRetriever</span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_text_splitters </span><span><span leaf="">import</span></span><span leaf=""> RecursiveCharacterTextSplitter</span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> langchain_community.storage </span><span><span leaf="">import</span></span><span leaf=""> InMemoryStore</span><span leaf=""><br></span><span leaf=""><br></span><span><span leaf=""># 小块:用于检索</span></span><span leaf=""><br></span><span leaf="">child_splitter = RecursiveCharacterTextSplitter(chunk_size=</span><span><span leaf="">200</span></span><span leaf="">)</span><span leaf=""><br></span><span><span leaf=""># 大块:用于返回</span></span><span leaf=""><br></span><span leaf="">parent_splitter = RecursiveCharacterTextSplitter(chunk_size=</span><span><span leaf="">1000</span></span><span leaf="">)</span><span leaf=""><br></span><span leaf=""><br></span><span leaf="">retriever = ParentDocumentRetriever(</span><span leaf=""><br></span><span leaf=""> vectorstore=vectorstore, </span><span><span leaf=""># 存小块的向量</span></span><span leaf=""><br></span><span leaf=""> docstore=InMemoryStore(), </span><span><span leaf=""># 存大块的原文</span></span><span leaf=""><br></span><span leaf=""> child_splitter=child_splitter,</span><span leaf=""><br></span><span leaf=""> parent_splitter=parent_splitter,</span><span leaf=""><br></span><span leaf="">)</span><span leaf=""><br></span>
用户检索到小块,但返回给模型的是小块所属的大块。这样既保证了检索精度(小块更精准),又保证了上下文完整(大块不丢信息)。
策略6:自适应切分(最前沿)
根据内容类型自动选择切分策略——表格用表格切分、代码用代码切分、文本用语义切分:
<span><span leaf="">from</span></span><span leaf=""> unstructured.partition.auto </span><span><span leaf="">import</span></span><span leaf=""> partition</span><span leaf=""><br></span><span><span leaf="">from</span></span><span leaf=""> unstructured.staging.base </span><span><span leaf="">import</span></span><span leaf=""> elements_to_chunks</span><span leaf=""><br></span><span leaf=""><br></span><span><span leaf=""># 自动识别文档元素类型</span></span><span leaf=""><br></span><span leaf="">elements = partition(filename=</span><span><span leaf="">"report.pdf"</span></span><span leaf="">)</span><span leaf=""><br></span><span><span leaf=""># 表格、代码块、列表等不同元素用不同策略处理</span></span><span leaf=""><br></span><span leaf="">chunks = elements_to_chunks(elements)</span><span leaf=""><br></span>
复杂但效果最好,适合文档类型杂、质量要求高的生产场景。
chunk_size怎么选?一个实用的调参方法
chunk_size没有万能最优值,但有一个系统化的调参方法:
Step 1:从500字符开始试
500-800字符是大部分中文场景的起点。
Step 2:评估检索效果
用一组测试问题跑一遍,看两个指标:
-
召回率:该找到的chunk找到了没?
-
上下文完整率:找到的chunk信息够不够回答问题?
Step 3:根据结果调整
| 现象
|
原因
|
调整方向
找到了但信息不完整
|
chunk太小,上下文被切断
|
调大chunk_size
| |
找到了但噪音太多
|
chunk太大,混入无关内容
|
调小chunk_size
| |
根本找不到
|
chunk切断了关键段落
|
增加overlap或换切分策略
| |
找到了但答不对
|
不是切分问题,是检索或提示词问题
|
别调chunk了,查别的环节
|
Step 4:加入元数据
给每个chunk加元数据,后续检索时可以用元数据过滤:
<span><span leaf="">from</span></span><span leaf=""> langchain_core.documents </span><span><span leaf="">import</span></span><span leaf=""> Document</span><span leaf=""><br></span><span leaf=""><br></span><span leaf="">chunk = Document(</span><span leaf=""><br></span><span leaf=""> page_content=</span><span><span leaf="">"公司年假政策:入职满1年可享受5天带薪年假..."</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> metadata={</span><span leaf=""><br></span><span leaf=""> </span><span><span leaf="">"source"</span></span><span leaf="">: </span><span><span leaf="">"员工手册v3.2.pdf"</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> </span><span><span leaf="">"page"</span></span><span leaf="">: </span><span><span leaf="">42</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> </span><span><span leaf="">"section"</span></span><span leaf="">: </span><span><span leaf="">"假期管理"</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> </span><span><span leaf="">"doc_type"</span></span><span leaf="">: </span><span><span leaf="">"policy"</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> </span><span><span leaf="">"update_date"</span></span><span leaf="">: </span><span><span leaf="">"2025-03-15"</span></span><span leaf="">,</span><span leaf=""><br></span><span leaf=""> }</span><span leaf=""><br></span><span leaf="">)</span><span leaf=""><br></span>
检索时可以过滤:只搜"假期管理"章节的、只搜2025年更新的文档。这样精确率直接上一个台阶。
不同场景的推荐配置
| 场景
|
推荐切分
|
chunk_size
|
overlap
|
特殊处理
法律合同
|
按条款切分
|
800-1200
|
100
|
保留条款编号
| |
技术文档
|
按标题结构
|
500-800
|
50
|
代码块单独切
| |
FAQ问答
|
按问答对
|
200-400
|
0
|
一个Q-A就是一个chunk
| |
论文
|
按章节
|
800-1000
|
100
|
摘要和结论单独存
| |
新闻资讯
|
递归字符
|
300-500
|
30
|
加时间元数据
|
我踩过的切分坑
1. chunk_overlap设太大
overlap设100意味着每个chunk有100字符是跟相邻chunk重复的。如果你存10万个chunk,相当于浪费了大量的存储和检索开销。overlap建议设chunk_size的5%-10% ,够防止关键信息被切断就行。
2. 中文分词没考虑
RecursiveCharacterTextSplitter的默认separators是英文优先的。中文文档建议加上"。""!""?"";“等中文标点:
<span leaf="">separators=[</span><span><span leaf="">"\n\n"</span></span><span leaf="">, </span><span><span leaf="">"\n"</span></span><span leaf="">, </span><span><span leaf="">"。"</span></span><span leaf="">, </span><span><span leaf="">"!"</span></span><span leaf="">, </span><span><span leaf="">"?"</span></span><span leaf="">, </span><span><span leaf="">";"</span></span><span leaf="">, </span><span><span leaf="">","</span></span><span leaf="">, </span><span><span leaf="">" "</span></span><span leaf="">, </span><span><span leaf="">""</span></span><span leaf="">]</span><span leaf=""><br></span>
3. 元数据丢了
有些切分器会把原文档的元数据丢掉。切分后一定要检查:chunk.metadata里有没有source、page等信息。没有的话检索时就没法做过滤。
4. 表格被切碎
合同、财报里的表格,按字符切分后完全不可用。要么用能识别表格的解析器,要么把表格转成Markdown/HTML格式再存。
下篇预告
下一篇讲Embedding模型选型和向量数据库对比——你的知识库用哪种Embedding、用哪个向量库,直接决定了检索的天花板。我会对比OpenAI、BGE、Jina等主流Embedding,以及Chroma、FAISS、Milvus、Qdrant等向量库的选型建议。
你现在用的切分方式是哪种?chunk_size设的多少?效果怎么样?评论区聊聊。
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260822/RAG%E6%96%87%E6%A1%A3%E5%A4%84%E7%90%86%E4%B8%8E%E5%88%87%E5%88%86%E7%AD%96%E7%95%A56%E7%A7%8D%E5%88%86%E5%9D%97%E6%96%B9%E5%BC%8F%E5%AF%B9%E6%AF%9480_%E7%9A%84%E6%A3%80%E7%B4%A2%E9%97%AE%E9%A2%98%E4%BB%8E%E8%BF%99%E9%87%8C%E8%A7%A3%E5%86%B3/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com