大家好,我是云途。知识库效果差,很多时候不是模型不够强,而是原始文档里混着页眉、页脚、目录、乱码和重复段落。
转换、清洗和切分的目标,是让每一个片段都能独立说明一件事,同时保留它来自哪里。
先固定处理流水线
转换时先保留结构
- 保留标题层级、段落、列表和表格说明。
- 扫描版 PDF 先做 OCR,再抽查数字、日期和专有名词。
- 图片中的关键结论要转成文字说明,普通装饰图可以忽略。
- 原文件只读保存,处理结果放入独立目录。
knowledge/
├── source/ # 原文件,只读保留
├── normalized/ # 转换后的统一文本
├── chunks/ # 可检索片段
└── manifest.csv # 来源、版本、日期与权限清洗不是把内容改写得更漂亮
清洗只删除噪声、修复明显转换错误并统一格式。不要用模型自由改写事实,否则后续引用已经不是原文证据。
- 删除重复页眉、页脚和导航。
- 合并被错误断开的句子。
- 保留版本号、日期、单位和限制条件。
- 遇到无法确认的乱码,标记待核对,不自行猜测。
一个片段只解决一个相对完整的问题
不要机械地每 500 个字切一刀。优先按标题和语义边界切分;片段太短会失去上下文,太长会让检索结果夹带大量无关内容。
标题
片段所属章节,帮助理解语境。
正文
可以独立阅读的完整内容。
来源
原文件、页码或网页地址。
版本
发布日期、修订日期或有效期。
每个片段都能读懂,也能找到原件
- 原文件只读保留。
- 转换结果抽查过数字和专有名词。
- 清洗没有改写事实。
- 片段保留标题、来源和版本。