7 天做出个人知识库

统一格式
并保留可追溯原件

把 PDF、Word、网页和笔记转换为可读文本,同时保留原件、版本和转换记录。

预计阅读 24 分钟公开免费核验于 2026.08.19
内容目录 当前:第 02
7 天完成第一个 AI 项目7
7 天学会 DeepSeek Harness7
7 天建立 Agent 工作流7
7 天做出个人知识库7
本文目录 8 个部分

大家好,我是云途。今天把不同格式的资料整理成系统能稳定读取的文本。

原件保持只读,转换结果可以重建。我们会抽查数字、标题、表格和专有名词,避免转换阶段悄悄改变事实。

先理解今天的原理

检索系统通常处理文本和元数据。PDF 的视觉页面、扫描图片、Word 样式和网页菜单需要经过解析或 OCR 才能进入后续流程。

转换会丢失结构或产生识别错误,因此每份处理文本都要记录原件、工具、时间和版本。这样发现问题时能回到源文件重新处理。

原件经过转换、清洗和切分,每一步都保留来源与版本。原文件转换清洗切分元数据可检索片段
原件经过转换、清洗和切分,每一步都保留来源与版本。

为什么今天要做这件事

  1. 统一文本格式让后续清洗和切分使用同一套方法。
  2. 保留原件可以核对转换错误和版本差异。
  3. 转换日志能判断错误来自资料还是解析工具。

开始前检查

这是第 02 天。先完成下面的检查,再开始操作。缺少关键材料时,先补材料,不要让 Agent 猜。

  1. 资料清单已经确认。
  2. 原件复制到只读 source 目录。
  3. 为扫描件准备 OCR 方法,并确认处理环境符合隐私要求。

一步一步完成

第 1 步:建立 source、normalized、logs 和 tests 目录

这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。

  1. 建立 source、normalized、logs 和 tests 目录。
  2. 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
  3. 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 2 步。
完成这一步后,你应该看到:建立 source、normalized、logs 和 tests 目录,产物内容完整并且可以重新找到。

第 2 步:逐份转换为 Markdown 或纯文本

这一步会让环境或项目发生变化。开始前先保存当前状态,执行时记录真实入口、参数和输出,出现异常就停在当前步骤排查。

  1. 逐份转换为 Markdown 或纯文本。
  2. 保存执行命令、输入参数、开始前状态和结束后的输出。
  3. 重新运行一次最小检查,确认结果可以稳定复现。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 3 步。
完成这一步后,你应该看到:逐份转换为 Markdown 或纯文本,执行过程与可复现结果已经记录。

第 3 步:为输出补上 source_id、标题、版本和转换工具

这一步会让环境或项目发生变化。开始前先保存当前状态,执行时记录真实入口、参数和输出,出现异常就停在当前步骤排查。

  1. 为输出补上 source_id、标题、版本和转换工具。
  2. 保存执行命令、输入参数、开始前状态和结束后的输出。
  3. 重新运行一次最小检查,确认结果可以稳定复现。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 4 步。
完成这一步后,你应该看到:为输出补上 source_id、标题、版本和转换工具,执行过程与可复现结果已经记录。

第 4 步:抽查标题、数字、日期、表格和专有名词

这一步要用证据判断结果。先写预期,再执行测试,最后分别记录实际结果与结论;失败项保留原样,便于定位原因。

  1. 抽查标题、数字、日期、表格和专有名词。
  2. 记录测试条件、预期结果、实际结果和是否通过。
  3. 失败时保存复现步骤与证据,修复后重新执行同一项检查。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 5 步。
完成这一步后,你应该看到:抽查标题、数字、日期、表格和专有名词,每一项都有预期、实际结果和明确结论。
VS Code 中打开的真实原件与标准化清单
四份课程样例原件均记录 SHA-256、用途和转换结果;标准化文本仍可回到唯一原件。

第 5 步:记录转换失败和需要人工处理的页面

这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。

  1. 记录转换失败和需要人工处理的页面。
  2. 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
  3. 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
  4. 对照今天的目标完成最后检查,确认所有证据已经保存。
完成这一步后,你应该看到:记录转换失败和需要人工处理的页面,产物内容完整并且可以重新找到。
处理目录与文档头TEXT
personal-kb/
├── source/          # 只读原件
├── normalized/      # 统一文本
├── logs/            # 转换记录
├── tests/
└── manifest.csv

---
source_id: DOC-001
source_file: source/setup.pdf
version: 2026-08-19
converted_by: <工具与版本>
converted_at: 2026-08-19
---
转换产物必须能回到唯一原件。
当天操作记录MARKDOWN
# 第 02 天操作记录

## 今天使用的入口与版本

## 实际完成的步骤
- [ ] 1. 建立 source、normalized、logs 和 tests 目录。
- [ ] 2. 逐份转换为 Markdown 或纯文本。
- [ ] 3. 为输出补上 source_id、标题、版本和转换工具。
- [ ] 4. 抽查标题、数字、日期、表格和专有名词。
- [ ] 5. 记录转换失败和需要人工处理的页面。

## 保存的证据
- 文件:
- 截图:
- 命令或测试结果:

## 与文章不同的地方

## 下一步
请填写实际发生的情况。没有执行的步骤保持未勾选,遇到的差异直接写入记录。

这次真实操作得到了什么

S04 第 2 天真实操作结果
4 份原件完成可重复标准化
  1. 统一换行、行尾空格和连续空行;每份原件保存 SHA-256,原件仍是唯一真源。
本次实际结果:处理文本可以重建,格式处理不会偷偷改写事实。

正确结果长什么样

完成操作后,用结果来判断今天是否学会。页面能打开或命令能运行,只能说明流程启动了;下面这些证据同时出现,今天才算完成。

  1. 每份原件都有对应的统一文本或失败记录。
  2. 统一文本能通过 source_id 找到原件。
  3. 关键数字、标题、表格和专有名词已经抽查。
  4. 原件未被覆盖,转换工具和时间有记录。

常见错误与恢复

直接在原 PDF 上修改

恢复原件,只在 normalized 保存处理结果。

OCR 后不抽查

重点检查数字、英文名、日期和表格。

处理文本没有来源

补上 source_id、原文件和版本元数据。

留给明天的材料

结束前把今天的关键结果保存到项目目录。下一天会直接使用这些材料,保存清楚可以减少重复说明和错误猜测。

  1. 只读原件目录。
  2. 带来源元数据的统一文本。
  3. 转换日志与失败清单。
完成检查

第 02 天完成检查

  • 每份原件都有对应的统一文本或失败记录。
  • 统一文本能通过 source_id 找到原件。
  • 关键数字、标题、表格和专有名词已经抽查。
  • 原件未被覆盖,转换工具和时间有记录。

官方依据与延伸阅读

图文教程:RAG 是什么图文教程:文档清洗与切分Dify Knowledge 官方概览OpenAI Retrieval 指南