<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>PDF向量化 on 知识铺的博客</title>
    <link>https://index.zshipu.com/geek001/tags/PDF%E5%90%91%E9%87%8F%E5%8C%96/</link>
    <description>Recent content in PDF向量化 on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 20 Aug 2024 02:49:44 +0000</lastBuildDate>
    <atom:link href="https://index.zshipu.com/geek001/tags/PDF%E5%90%91%E9%87%8F%E5%8C%96/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>PDF文档向量化详细过程</title>
      <link>https://index.zshipu.com/geek001/post/20240801/PDF%E6%96%87%E6%A1%A3%E5%90%91%E9%87%8F%E5%8C%96%E8%AF%A6%E7%BB%86%E8%BF%87%E7%A8%8B--%E7%9F%A5%E8%AF%86%E9%93%BA/</link>
      <pubDate>Tue, 20 Aug 2024 02:49:44 +0000</pubDate>
      <guid>https://index.zshipu.com/geek001/post/20240801/PDF%E6%96%87%E6%A1%A3%E5%90%91%E9%87%8F%E5%8C%96%E8%AF%A6%E7%BB%86%E8%BF%87%E7%A8%8B--%E7%9F%A5%E8%AF%86%E9%93%BA/</guid>
      <description>读取文件 使用的 pdf 文档是一个 地址树模型的中文地址提取方法.pdf 文档，内容截图如下： 参数说明 基本的文档处理参数如下： chunk_overlap = 50 chunk_size = 250 embed_model = &amp;#39;m3e-large&amp;#39; vs_type = &amp;#39;fassi&amp;#39; zh_title_enhance = False 在进行文本处理时，合理设置参数对于确保信息完整性和处理效率至关重要。以下是对几个关键参数的详细解释： 文本块重叠量 (chunk_overlap): 此参数设置为50，意味</description>
    </item>
  </channel>
</rss>
