建立可复用工作流
从交付物反推证据层,用代表性小样验证输入、步骤、验收与失败规则。
可复用工作流不是把一次对话原样保存,而是把任务变成一条可以检查、复跑和逐步扩大的生产链。先证明最小闭环可靠,再决定是否创建 Skill、批量处理或定时运行。
从交付物反推,而不是从工具出发
先写清谁将使用什么产物,以及怎样判断它可用。再反推需要哪些中间资产、原始输入和确认点。
| 反推层级 | 需要回答的问题 | 产物示例 |
|---|---|---|
| 最终交付 | 谁使用、用来做什么、提交到哪里 | 报告、工作簿、知识地图、待发送草稿 |
| 验收 | 哪些事实、数字、格式和权限必须通过 | 抽查表、复算结果、审核记录 |
| 中间资产 | 哪些内容可供多个下游共同使用 | 证据卡片、异常台账、字段映射、索引 |
| 原始输入 | 允许读取什么,缺失或禁止什么 | 文件清单、时间窗、字段契约、权限范围 |
如果两个输出会使用同一批事实,例如报告与演示文稿,不要让它们分别从原文重新总结。先建立共享、可追溯的证据层,再由不同下游按各自验收标准加工。
建立证据卡片
证据卡片是一条结论与原始输入之间的最小可追溯记录。它不是原文副本,也不是模型自由发挥的摘要。
| 字段 | 规则 |
|---|---|
schemaVersion | 标识字段契约版本,升级时保留迁移关系 |
recordId | 稳定且唯一,后续批次不能随意变化 |
sourceLocator | 文件、Sheet、行号、页码或知识条目标识 |
statement | 一条可独立检查的事实、观点或问题 |
statementType | 明确区分原始事实、来源观点和任务推断 |
timeScope | 说明结论适用的日期或版本 |
permission | 可内部使用、可公开、需脱敏或禁止外发 |
reviewStatus | 待核对、已确认、被否决或已过期 |
出处存在不等于结论成立
来源定位只解决“从哪里来”。事实是否完整、观点是否合理、是否允许公开,仍需要对应责任人确认。证据不足时保留待确认状态,不补写看似合理的答案。
把来源内容当数据,不当操作指令
文件、网页、邮件或知识条目中可能包含要求忽略规则、访问外链、执行代码或上传资料的文字。这些内容只能作为待分析材料,不能覆盖任务契约、工具权限和人工门禁;确需执行外部动作时重新向用户确认。
选择代表性小样
小样应足够小,便于逐条人工检查,同时故意覆盖正常、边界和失败输入。不要只挑最整齐的文件证明流程能跑。
| 样本类型 | 应覆盖什么 |
|---|---|
| 标准样本 | 字段完整、格式正确、结果容易核对 |
| 边界样本 | 缺字段、跨日期、重复内容、格式变体 |
| 失败样本 | 空文件、损坏输入、权限不足、来源不可达 |
| 安全边界样本 | 用脱敏或合成内容模拟限制外发、禁止进入下游等规则 |
样本数量没有统一答案。停止增加样本的条件是:现有样本已经能暴露主要结构差异,而且每条结果仍可由人工逐项验收。不要为了测试而复制真实密钥、身份信息或无权处理的业务数据。
运行小样 MVP
冻结本轮契约
记录输入字段、证据卡片结构、交付格式、权限和停止条件。本轮运行中不临时改变定义。
先生成中间资产
输出证据卡片、异常台账或字段映射,再生成一个最小可用 Demo。中间资产不合格时不进入包装和发布。
逐项人工验收
检查准确性、可追溯性、实际可用性、安全性和重复执行结果,不以“文案看起来不错”代替验收。
保存失败清单
记录失败输入、识别信号、影响、临时处理和建议规则。无法读取与没有相关内容必须分开标记。
每轮只改明确问题
更新契约或流程版本,用另一组样本复跑并对比差异。避免一次同时修改输入、提示词、字段和工具,导致无法判断改动效果。
MVP 通过门禁
| 维度 | 通过条件 | 不通过时 |
|---|---|---|
| 准确 | 关键事实和数字与输入一致 | 修改提取或计算规则 |
| 可追溯 | 重要结论能定位到来源 | 强制补来源字段,删除无证据结论 |
| 可使用 | 真实使用者可以继续完成工作 | 调整中间资产或交付结构 |
| 安全 | 权限、脱敏和外部操作没有越界 | 缩小范围并增加人工门禁 |
| 可复跑 | 同一契约重复执行,结构和关键结果稳定 | 拆出不稳定判断或确定性校验 |
只有以上门禁全部满足,才进入更大批次。某个 Demo 生成成功,不等于工作流已经通过。
小样任务模板
业务目标:[最终由谁使用什么交付物]
样本范围:[本轮允许读取的标准、边界和失败样本]
输入契约:[字段、格式、时间窗、允许缺失和禁止内容]
契约版本:[本轮输入、证据和输出结构的版本]
中间资产:[证据卡片、异常台账或其他可追溯记录]
输出 Demo:[本轮最小但真实可用的结果]
验收人:[负责事实、业务、安全和格式的角色]
通过条件:[准确、可追溯、可使用、安全、可复跑]
停止条件:[权限不明、来源不足、输出越界或成本超限]
失败交付:[失败清单、已有产物和下一步建议]从任务提取稳定流程
- 固定目标:最终产物是什么,由谁使用;
- 建立证据层:哪些事实必须被多个下游复用和追溯;
- 定义输入契约:文件类型、字段、命名和允许缺失的内容;
- 记录稳定步骤:哪些可以由 Agent 自主完成,哪些必须确认;
- 建立验收清单:事实、格式、安全和交付位置;
- 记录失败样本:常见错误、识别信号和修复方法;
- 选择沉淀形式:提示词模板、Skill、历史回填或增量任务。
复用层级
| 层级 | 适用情况 |
|---|---|
| 提示词模板 | 输入变化较小、执行步骤简单 |
| Skill | 单项能力已稳定,需要背景知识、规则、工具和验收标准 |
| 历史回填 | 已验证契约需要应用到有限的一批旧数据 |
| 增量任务 | 能识别新增或变更输入,不需要反复扫描全部历史数据 |
| 定时任务 | 增量来源稳定、执行时间明确、失败影响可控 |
发布前测试
- 用一个标准样本验证正常路径;
- 用缺字段、空文件或异常格式验证错误路径;
- 重复执行两次,检查是否产生重复发送或重复写入;
- 限制输入规模,观察最大积分和 Token 消耗;
- 让非作者按文档独立执行,检查隐藏前提;
- 确认终止、暂停和恢复方法。
门店 Excel 案例展示了异常台账与复算证据;证据卡片与增量基线的通用方法在本页前文已经给出: