7 天建立 Agent 工作流

用真实一周任务
验证工作流

完整运行真实任务,比较时间、人工修改和失败点,并确定下一轮唯一改进。

预计阅读 29 分钟公开免费核验于 2026.08.19
内容目录 当前:第 07
7 天完成第一个 AI 项目7
7 天学会 DeepSeek Harness7
7 天建立 Agent 工作流7
7 天做出个人知识库7
本文目录 8 个部分

大家好,我是云途。今天使用真实主题和公开来源完整运行一次工作流。

先按现有版本完成,再集中复盘。运行中想到的改进先记录,避免不断改规则导致无法判断哪一版有效。

先理解今天的原理

流程验证要同时看结果质量、耗时、人工介入和可恢复性。只看最终文章会忽略隐藏成本,只看节省时间也可能牺牲事实可靠性。

改进需要基于频繁且高影响的问题。一次运行出现的偶然偏好可以记录,连续发生的来源遗漏、字段缺失或恢复失败才值得优先修改。

真实运行把规则、工具、Skill、检查和人工判断连接成可维护工作流。Harness运行环境Agent判断与行动Skill专项方法Tools实际能力Workflow步骤与交接
真实运行把规则、工具、Skill、检查和人工判断连接成可维护工作流。

为什么今天要做这件事

  1. 真实输入会出现练习样本没有覆盖的变化。
  2. 与人工基线比较可以判断自动化是否产生实际价值。
  3. 冻结当前版本后,下一次运行才能形成可比较数据。

开始前检查

这是第 07 天。先完成下面的检查,再开始操作。缺少关键材料时,先补材料,不要让 Agent 猜。

  1. 准备本周真实主题和允许来源。
  2. 规则、模板、Skill、测试和 STATE 均为当前确认版。
  3. 保留第 1 天人工耗时与问题基线。

一步一步完成

第 1 步:从空运行目录开始完整执行

这一步会让环境或项目发生变化。开始前先保存当前状态,执行时记录真实入口、参数和输出,出现异常就停在当前步骤排查。

  1. 从空运行目录开始完整执行。
  2. 保存执行命令、输入参数、开始前状态和结束后的输出。
  3. 重新运行一次最小检查,确认结果可以稳定复现。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 2 步。
完成这一步后,你应该看到:从空运行目录开始完整执行,执行过程与可复现结果已经记录。

第 2 步:记录每个阶段耗时、人工批准和失败

这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。

  1. 记录每个阶段耗时、人工批准和失败。
  2. 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
  3. 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 3 步。
完成这一步后,你应该看到:记录每个阶段耗时、人工批准和失败,产物内容完整并且可以重新找到。

第 3 步:按测试表检查来源、事实、格式和权限

这一步负责确认事实。请以当前页面、文件或命令输出为准,同时记下来源、版本和检查时间,避免只凭印象继续操作。

  1. 按测试表检查来源、事实、格式和权限。
  2. 把看到的实际信息摘出来;教程与本机不同的地方单独标注。
  3. 保存链接、截图或命令输出,确保之后可以复查。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 4 步。
完成这一步后,你应该看到:按测试表检查来源、事实、格式和权限,相关来源和实际结果已经保存。
真实一周任务运行完成并等待人工复核的最终看板
真实运行共核验两条公开来源和六条事实,自动化止于人工复核,不执行发布。浏览器本机路径已从发布图中裁除。

第 4 步:由人工审阅并记录修改最多的位置

这一步会生成后续课程继续使用的材料。文件名、保存位置和内容边界需要写清楚,让第二天重新打开项目时仍然知道它的用途。

  1. 由人工审阅并记录修改最多的位置。
  2. 打开新材料逐项检查,删除示例占位内容,补上本次真实信息。
  3. 记录保存路径,并确认关闭页面或重新打开项目后仍能找到。
  4. 对照今天的目标检查这一项,发现偏差时先处理偏差,再进入第 5 步。
完成这一步后,你应该看到:由人工审阅并记录修改最多的位置,产物内容完整并且可以重新找到。

第 5 步:冻结版本,比较基线,并只选一个下一轮改进

这一步要用证据判断结果。先写预期,再执行测试,最后分别记录实际结果与结论;失败项保留原样,便于定位原因。

  1. 冻结版本,比较基线,并只选一个下一轮改进。
  2. 记录测试条件、预期结果、实际结果和是否通过。
  3. 失败时保存复现步骤与证据,修复后重新执行同一项检查。
  4. 对照今天的目标完成最后检查,确认所有证据已经保存。
完成这一步后,你应该看到:冻结版本,比较基线,并只选一个下一轮改进,每一项都有预期、实际结果和明确结论。
VS Code 中打开的真实任务验收评分卡
最后按来源、事实、文件、失败恢复和人工复核逐项验收,并冻结当前版本。
真实运行评分卡MARKDOWN
## 结果质量
- 来源可追溯:
- 事实与推断分开:
- 模板字段完整:

## 效率
- 原人工耗时:
- 本次总耗时:
- 人工审阅耗时:

## 稳定性
- 失败次数与阶段:
- 是否成功恢复:
- 人工修改最多位置:

## 下一轮唯一改进
保留实际数字和修改记录,下一次继续使用同一评分卡。
当天操作记录MARKDOWN
# 第 07 天操作记录

## 今天使用的入口与版本

## 实际完成的步骤
- [ ] 1. 从空运行目录开始完整执行。
- [ ] 2. 记录每个阶段耗时、人工批准和失败。
- [ ] 3. 按测试表检查来源、事实、格式和权限。
- [ ] 4. 由人工审阅并记录修改最多的位置。
- [ ] 5. 冻结版本,比较基线,并只选一个下一轮改进。

## 保存的证据
- 文件:
- 截图:
- 命令或测试结果:

## 与文章不同的地方

## 下一步
请填写实际发生的情况。没有执行的步骤保持未勾选,遇到的差异直接写入记录。

这次真实操作得到了什么

S03 第 7 天真实操作结果
真实周任务完成并冻结
  1. 2026-W34 运行生成 weekly-brief、QA、STATE 和 dashboard;2 个来源、6 条事实、0 个缺失链接。
本次实际结果:自动测试通过、npm audit 为 0,版本冻结为 1.0.0,仍不自动发布。

正确结果长什么样

完成操作后,用结果来判断今天是否学会。页面能打开或命令能运行,只能说明流程启动了;下面这些证据同时出现,今天才算完成。

  1. 真实周报达到工作流合同与检查标准。
  2. 耗时、人工批准、失败和修改记录完整。
  3. 结果中的关键结论都能回到原始来源。
  4. 当前版本已经冻结,并确定下一轮唯一改进。

常见错误与恢复

运行中不断改 Skill

先记录问题并完成当前版本,复盘后再改。

只比较总耗时

同时比较质量、人工审阅和失败恢复。

一次列出十个改进

选择最频繁且影响最大的一个。

留给明天的材料

结束前把今天的关键结果保存到项目目录。下一天会直接使用这些材料,保存清楚可以减少重复说明和错误猜测。

  1. 一次真实运行的全部文件。
  2. 评分卡、人工修改和检查证据。
  3. 冻结版本与下一轮唯一改进。
完成检查

第 07 天完成检查

  • 真实周报达到工作流合同与检查标准。
  • 耗时、人工批准、失败和修改记录完整。
  • 结果中的关键结论都能回到原始来源。
  • 当前版本已经冻结,并确定下一轮唯一改进。

官方依据与延伸阅读

Codex 系统教学:项目规则Codex 系统教学:第一个 Skill图文教程:规则、Skill 与 Agent