7 天做出个人知识库

清理噪声
并按语义切分

删除重复导航和页眉页脚,按完整问题与章节切分,并为片段保留上下文。

预计阅读 27 分钟公开免费核验于 2026.08.19
内容目录 当前:第 03
7 天完成第一个 AI 项目7
7 天学会 DeepSeek Harness7
7 天建立 Agent 工作流7
7 天做出个人知识库7
本文目录 8 个部分

大家好,我是云途。今天把统一文本变成适合检索的片段。

片段太大时会混入无关内容,太小时会失去条件和结论。我们的目标是让每个片段能够独立回答一个明确问题。

先理解今天的原理

切分决定检索系统能够取回什么单位。按固定字符粗暴切分可能把步骤、警告和适用条件拆开。优先沿标题、段落、列表和完整问答边界处理。

清洗负责删除菜单、重复页眉和乱码,但不能自由改写事实。片段需要携带来源、章节、版本、权限和相邻关系,才能在回答时解释出处。

清洗后的文本按语义切分,并为每个片段补充来源和权限元数据。原文件转换清洗切分元数据可检索片段
清洗后的文本按语义切分,并为每个片段补充来源和权限元数据。

为什么今天要做这件事

  1. 噪声会占用召回位置并造成错误匹配。
  2. 完整语义片段可以保留问题、条件和结论。
  3. 元数据支持引用、过滤、版本更新和删除。

开始前检查

这是第 03 天。先完成下面的检查,再开始操作。缺少关键材料时,先补材料,不要让 Agent 猜。

  1. 统一文本与原件可以一一对应。
  2. 准备五个真实问题,用来观察理想片段。
  3. 确定片段必须保留的元数据字段。

一步一步完成

第 1 步:删除重复菜单、页眉页脚和无意义空白

先把这一项单独完成,再继续后面的动作。操作过程要留下可以检查的材料,方便发现偏差时回到当前步骤。

  1. 删除重复菜单、页眉页脚和无意义空白。
  2. 记录输入、实际动作和得到的结果。
  3. 对照今日目标检查;结果不一致时,先保存证据并处理当前问题。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 2 步。
完成这一步后,你应该看到:删除重复菜单、页眉页脚和无意义空白,过程与结果均有可复查证据。

第 2 步:标记标题层级、步骤、警告和问答边界

先把这一项单独完成,再继续后面的动作。操作过程要留下可以检查的材料,方便发现偏差时回到当前步骤。

  1. 标记标题层级、步骤、警告和问答边界。
  2. 记录输入、实际动作和得到的结果。
  3. 对照今日目标检查;结果不一致时,先保存证据并处理当前问题。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 3 步。
完成这一步后,你应该看到:标记标题层级、步骤、警告和问答边界,过程与结果均有可复查证据。

第 3 步:按完整主题切分,必要时保留少量相邻重叠

先把这一项单独完成,再继续后面的动作。操作过程要留下可以检查的材料,方便发现偏差时回到当前步骤。

  1. 按完整主题切分,必要时保留少量相邻重叠。
  2. 记录输入、实际动作和得到的结果。
  3. 对照今日目标检查;结果不一致时,先保存证据并处理当前问题。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 4 步。
完成这一步后,你应该看到:按完整主题切分,必要时保留少量相邻重叠,过程与结果均有可复查证据。

第 4 步:为每片段生成唯一 chunk_id 和来源元数据

这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。

  1. 为每片段生成唯一 chunk_id 和来源元数据。
  2. 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
  3. 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 5 步。
完成这一步后,你应该看到:为每片段生成唯一 chunk_id 和来源元数据,产物内容完整并且可以重新找到。
VS Code 中打开的真实清洗与切分报告
实际生成十个语义片段,每个片段保存 sourceId、原件相对路径、章节和正文哈希。

第 5 步:抽查五个问题,确认答案所需条件没有被拆散

这一步负责确认事实。请以当前页面、文件或命令输出为准,同时记下来源、版本和检查时间,避免只凭印象继续操作。

  1. 抽查五个问题,确认答案所需条件没有被拆散。
  2. 把看到的实际信息摘出来;教程与本机不同的地方单独标注。
  3. 保存链接、截图或命令输出,确保之后可以复查。
  4. 对照今天的目标完成最后检查,确认所有证据已经保存。
完成这一步后,你应该看到:抽查五个问题,确认答案所需条件没有被拆散,相关来源和实际结果已经保存。
片段示例MARKDOWN
---
chunk_id: DOC-001-C03
source_id: DOC-001
section: 本地启动
version: 2026-08-19
access: internal
previous: DOC-001-C02
next: DOC-001-C04
---

## 本地启动
前置条件:Node 版本满足项目要求。
操作:在项目目录安装依赖并运行本地脚本。
正确结果:终端显示本地地址,页面可以打开。
片段同时保留前置条件、操作和结果。
当天操作记录MARKDOWN
# 第 03 天操作记录

## 今天使用的入口与版本

## 实际完成的步骤
- [ ] 1. 删除重复菜单、页眉页脚和无意义空白。
- [ ] 2. 标记标题层级、步骤、警告和问答边界。
- [ ] 3. 按完整主题切分,必要时保留少量相邻重叠。
- [ ] 4. 为每片段生成唯一 chunk_id 和来源元数据。
- [ ] 5. 抽查五个问题,确认答案所需条件没有被拆散。

## 保存的证据
- 文件:
- 截图:
- 命令或测试结果:

## 与文章不同的地方

## 下一步
请填写实际发生的情况。没有执行的步骤保持未勾选,遇到的差异直接写入记录。

这次真实操作得到了什么

S04 第 3 天真实操作结果
按二级标题得到 10 个语义片段
  1. Harness 3 个、工作流 3 个、知识库规则 3 个、旧端口说明 1 个;每片段带路径、章节、chunkId 和哈希。
本次实际结果:答案可以从片段回到唯一原件和具体小节。

正确结果长什么样

完成操作后,用结果来判断今天是否学会。页面能打开或命令能运行,只能说明流程启动了;下面这些证据同时出现,今天才算完成。

  1. 重复导航、页眉页脚和乱码已清理。
  2. 片段没有把关键条件与结论拆开。
  3. 每个片段都有唯一编号、来源、版本和权限。
  4. 五个真实问题都能对应到合理片段。

常见错误与恢复

所有文件按固定字数切

优先使用标题、问答和完整步骤边界。

清洗时重写原意

只处理噪声,事实变化必须回到原件确认。

片段没有权限字段

补上访问级别,后续检索按权限过滤。

留给明天的材料

结束前把今天的关键结果保存到项目目录。下一天会直接使用这些材料,保存清楚可以减少重复说明和错误猜测。

  1. 清洗后的文本。
  2. 带完整元数据的片段目录。
  3. 五个问题与理想片段对照。
完成检查

第 03 天完成检查

  • 重复导航、页眉页脚和乱码已清理。
  • 片段没有把关键条件与结论拆开。
  • 每个片段都有唯一编号、来源、版本和权限。
  • 五个真实问题都能对应到合理片段。

官方依据与延伸阅读

图文教程:RAG 是什么图文教程:文档清洗与切分Dify Knowledge 官方概览OpenAI Retrieval 指南