进阶专题

文档怎样转换、
清洗并切分

把 PDF、Word 和网页整理成有来源、可更新、适合检索的文本片段。

预计阅读 14 分钟公开免费核验于 2026.08.19
内容目录 当前:第 24
开始前准备6
Agent 基础5
工具安装与配置6
模型与接口5
进阶专题5
本文目录 4 个部分

大家好,我是云途。知识库效果差,很多时候不是模型不够强,而是原始文档里混着页眉、页脚、目录、乱码和重复段落。

转换、清洗和切分的目标,是让每一个片段都能独立说明一件事,同时保留它来自哪里。

先固定处理流水线

原文件经过转换、清洗、切分和元数据补充后,才成为可以检索的片段。原文件转换清洗切分元数据可检索片段
原文件经过转换、清洗、切分和元数据补充后,才成为可以检索的片段。

转换时先保留结构

  1. 保留标题层级、段落、列表和表格说明。
  2. 扫描版 PDF 先做 OCR,再抽查数字、日期和专有名词。
  3. 图片中的关键结论要转成文字说明,普通装饰图可以忽略。
  4. 原文件只读保存,处理结果放入独立目录。
建议的资料目录TEXT
knowledge/
├── source/        # 原文件,只读保留
├── normalized/    # 转换后的统一文本
├── chunks/        # 可检索片段
└── manifest.csv   # 来源、版本、日期与权限
处理结果可以重建,原文件和来源清单必须保留。

清洗不是把内容改写得更漂亮

清洗只删除噪声、修复明显转换错误并统一格式。不要用模型自由改写事实,否则后续引用已经不是原文证据。

  1. 删除重复页眉、页脚和导航。
  2. 合并被错误断开的句子。
  3. 保留版本号、日期、单位和限制条件。
  4. 遇到无法确认的乱码,标记待核对,不自行猜测。

一个片段只解决一个相对完整的问题

不要机械地每 500 个字切一刀。优先按标题和语义边界切分;片段太短会失去上下文,太长会让检索结果夹带大量无关内容。

标题

片段所属章节,帮助理解语境。

正文

可以独立阅读的完整内容。

来源

原文件、页码或网页地址。

版本

发布日期、修订日期或有效期。

完成检查

每个片段都能读懂,也能找到原件

  • 原文件只读保留。
  • 转换结果抽查过数字和专有名词。
  • 清洗没有改写事实。
  • 片段保留标题、来源和版本。

官方依据与延伸阅读

Dify:创建知识库OpenAI Vector Store Files