大家好,我是云途。今天把不同格式的资料整理成系统能稳定读取的文本。
原件保持只读,转换结果可以重建。我们会抽查数字、标题、表格和专有名词,避免转换阶段悄悄改变事实。
先理解今天的原理
检索系统通常处理文本和元数据。PDF 的视觉页面、扫描图片、Word 样式和网页菜单需要经过解析或 OCR 才能进入后续流程。
转换会丢失结构或产生识别错误,因此每份处理文本都要记录原件、工具、时间和版本。这样发现问题时能回到源文件重新处理。
为什么今天要做这件事
- 统一文本格式让后续清洗和切分使用同一套方法。
- 保留原件可以核对转换错误和版本差异。
- 转换日志能判断错误来自资料还是解析工具。
开始前检查
这是第 02 天。先完成下面的检查,再开始操作。缺少关键材料时,先补材料,不要让 Agent 猜。
- 资料清单已经确认。
- 原件复制到只读 source 目录。
- 为扫描件准备 OCR 方法,并确认处理环境符合隐私要求。
一步一步完成
第 1 步:建立 source、normalized、logs 和 tests 目录
这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。
- 建立 source、normalized、logs 和 tests 目录。
- 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
- 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
- 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 2 步。
完成这一步后,你应该看到:建立 source、normalized、logs 和 tests 目录,产物内容完整并且可以重新找到。
第 2 步:逐份转换为 Markdown 或纯文本
这一步会让环境或项目发生变化。开始前先保存当前状态,执行时记录真实入口、参数和输出,出现异常就停在当前步骤排查。
- 逐份转换为 Markdown 或纯文本。
- 保存执行命令、输入参数、开始前状态和结束后的输出。
- 重新运行一次最小检查,确认结果可以稳定复现。
- 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 3 步。
完成这一步后,你应该看到:逐份转换为 Markdown 或纯文本,执行过程与可复现结果已经记录。
第 3 步:为输出补上 source_id、标题、版本和转换工具
这一步会让环境或项目发生变化。开始前先保存当前状态,执行时记录真实入口、参数和输出,出现异常就停在当前步骤排查。
- 为输出补上 source_id、标题、版本和转换工具。
- 保存执行命令、输入参数、开始前状态和结束后的输出。
- 重新运行一次最小检查,确认结果可以稳定复现。
- 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 4 步。
完成这一步后,你应该看到:为输出补上 source_id、标题、版本和转换工具,执行过程与可复现结果已经记录。
第 4 步:抽查标题、数字、日期、表格和专有名词
这一步要用证据判断结果。先写预期,再执行测试,最后分别记录实际结果与结论;失败项保留原样,便于定位原因。
- 抽查标题、数字、日期、表格和专有名词。
- 记录测试条件、预期结果、实际结果和是否通过。
- 失败时保存复现步骤与证据,修复后重新执行同一项检查。
- 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 5 步。
完成这一步后,你应该看到:抽查标题、数字、日期、表格和专有名词,每一项都有预期、实际结果和明确结论。

第 5 步:记录转换失败和需要人工处理的页面
这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。
- 记录转换失败和需要人工处理的页面。
- 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
- 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
- 对照今天的目标完成最后检查,确认所有证据已经保存。
完成这一步后,你应该看到:记录转换失败和需要人工处理的页面,产物内容完整并且可以重新找到。
personal-kb/
├── source/ # 只读原件
├── normalized/ # 统一文本
├── logs/ # 转换记录
├── tests/
└── manifest.csv
---
source_id: DOC-001
source_file: source/setup.pdf
version: 2026-08-19
converted_by: <工具与版本>
converted_at: 2026-08-19
---# 第 02 天操作记录
## 今天使用的入口与版本
## 实际完成的步骤
- [ ] 1. 建立 source、normalized、logs 和 tests 目录。
- [ ] 2. 逐份转换为 Markdown 或纯文本。
- [ ] 3. 为输出补上 source_id、标题、版本和转换工具。
- [ ] 4. 抽查标题、数字、日期、表格和专有名词。
- [ ] 5. 记录转换失败和需要人工处理的页面。
## 保存的证据
- 文件:
- 截图:
- 命令或测试结果:
## 与文章不同的地方
## 下一步这次真实操作得到了什么

- 统一换行、行尾空格和连续空行;每份原件保存 SHA-256,原件仍是唯一真源。
本次实际结果:处理文本可以重建,格式处理不会偷偷改写事实。
正确结果长什么样
完成操作后,用结果来判断今天是否学会。页面能打开或命令能运行,只能说明流程启动了;下面这些证据同时出现,今天才算完成。
- 每份原件都有对应的统一文本或失败记录。
- 统一文本能通过 source_id 找到原件。
- 关键数字、标题、表格和专有名词已经抽查。
- 原件未被覆盖,转换工具和时间有记录。
常见错误与恢复
直接在原 PDF 上修改
恢复原件,只在 normalized 保存处理结果。
OCR 后不抽查
重点检查数字、英文名、日期和表格。
处理文本没有来源
补上 source_id、原文件和版本元数据。
留给明天的材料
结束前把今天的关键结果保存到项目目录。下一天会直接使用这些材料,保存清楚可以减少重复说明和错误猜测。
- 只读原件目录。
- 带来源元数据的统一文本。
- 转换日志与失败清单。
第 02 天完成检查
- 每份原件都有对应的统一文本或失败记录。
- 统一文本能通过 source_id 找到原件。
- 关键数字、标题、表格和专有名词已经抽查。
- 原件未被覆盖,转换工具和时间有记录。