部署完成后,本章回答两个问题:每天怎么用这套系统,以及怎么知道它在正常运行。
部署后,你和 Agent 的协作模式会发生一个微妙但重要的变化——你从“纠错者”切换为“确认者”。
| 阶段 | 以前的发生顺序 | 现在的发生顺序 |
|---|---|---|
| 启动 | 你发任务 → Agent 直接做 | 你发任务 → Agent 输出启动清单 → 你确认(或说“直接做”) → 开始 |
| 执行 | Agent 输出 → 你检查 → 你纠正 | Agent 按 Skill 执行,自动注入避坑项 |
| 交付 | 你检查 → 发现套话/格式问题 → 你说 → 它改 | Agent 自动过五关闸门 → 你拿到的是干净结果 |
| 反馈 | 你说一句 → 它有时改过头有时没记住 | 你说一句 → 它记录到积分表,第二次才改规则 |
| 复盘 | 你凭感觉总结 | 你说“起飞” → Agent 自动跑九步复盘 |
核心变化:以前你在回路里充当反馈控制器,现在大部分反馈回路被 Agent 内化成了前馈和自监控。
你说:
帮我写一篇关于“秋日最后一天”的短篇,2000字左右。
Agent 自动执行(无需额外指令):
- 调用
feedforward_startup - 输出如下启动清单:
启动清单
任务类型:短篇创作
场景规律 L3:情绪定调优先于情节,结尾留白不升华
用户原则 L2:冷感叙事,拒绝 AI 总结;简洁不堆形容词
历史教训:上次“画面感不足”,本次加强环境白描
风险预判:
- P0:字数偏离过远
- P1:结尾不自觉总结
- P2:对话占比过高导致叙述单薄
避坑清单:开篇建立画面,结尾自然收束不点题;全程冷感,不堆形容词。
(等待确认或说“直接做”)
你说:
直接做
Agent:开始写作,并在交付前自动过 delivery_gate。
如果任务特别简单(如“帮我翻译一段话”),前馈清单也应简化,不强制长篇大论。你可以随时说“跳过清单直接做”。
你说:
这次结尾又总结了一句“秋天终将过去”,我不喜欢。
Agent 内部自动执行(你不需要额外指令):
- 归类:A类(违反 L2 审美原则)
- 在积分控制表中查找:若已有“结尾AI总结”条目,次数+1;若无,新建。
- 判断:
- 次数=1 → 仅修正本次,回复:“已记录,本次已修正。”
- 次数=2 → 自动触发下沉,回复:“‘结尾AI总结’已出现2次,我将此规则下沉至 L2 审美原则:‘拒绝任何形式的总结式收束’。是否同意?”
你的反馈越具体(如“结尾啰嗦”),Agent 越容易抽象为精确的错误模式。避免模糊反馈如“写得不好”。
你说:
起飞
Agent 自动调用 control_loop_review,按九步流程输出,最后你会看到类似:
[闭环梳理完成]
- 前馈审查:本周 feedforward 5次,均正常调用
- 积分下沉:1项已下沉(结尾AI总结 → L2)
- 层级净化:无混淆
- 闸门升级:建议在P1中增加“连续对话段落不超过6行”检查项,是否同意?
- 根因分析:略...
- 可复用提炼:建议创建 skill: dialogue_density_check
- 迁移提议:本轮无需(或:建议引入香农信息论控制对话密度)
你逐条确认/否决后,Agent 写入记忆并调用画像维护。
你说:
你现在记忆分几层?分别存什么?
Agent 应准确回答 L1 五条、L2 维度、L3 场景列表、积分表条目数。
你说:
积分控制表现在有哪些条目?
Agent 输出当前表状态。
每周花 2 分钟过一遍以下清单,确保系统没有悄悄退化。
| # | 检查点 | 正常表现 | 异常信号 |
|---|---|---|---|
| 1 | 前馈启动 | 每次新任务 Agent 都输出启动清单 | Agent 直接开始执行,跳过了清单 |
| 2 | 交付质量 | 交付物干净,无 AI 套话,格式正确 | 你又看到“综上所述”“值得注意的是” |
| 3 | 积分控制 | 同类问题你提第二次时,Agent 提出下沉 | 第三次你还得纠正同一问题 |
| 4 | 层级分离 | memory 里没有操作步骤,skill 里没有原则 | 某次你打开记忆发现里面塞满了步骤 |
| 5 | 闭环执行 | 说“起飞”后 Agent 跑完整九步 | 复盘输出敷衍、跳过根因分析 |
如果某个检查点异常,用对应指令快速修复:
- 前馈失效 →
以后每次任务前强制调用 feedforward_startup。 - 积分失效 →
请查看积分控制表,并确认所有 ≥2 次条目是否已下沉。 - 层级混淆 →
做一次层级净化扫描。 - 闸门松懈 →
重新执行一次完整的 delivery_gate 流程,并汇报结果。
以下四个定量指标可以帮助你判断系统是否真正生效(可偶尔观察,不必每日统计):
旧模式:同类问题你平均需要纠正 3-5 次才不再犯。 新模式(启用积分控制后):同类问题第 2 次出现即下沉,第 3 次起不应再出现。
判定:如果某个已下沉问题出现了第 3 次,说明下沉执行失败或 Skill 未被更新,需要启动闭环排查。
Agent 输出的启动清单中,P1 风险预判是否经常被你确认“对,就是这个”。
判定:前馈清单中至少 50% 以上的 P1 预判属于你确实在意的点,则前馈系统运行良好。若连续 5 次任务 P1 全被你说“不对”,说明 L2/L3 需要更新或 Agent 对你的理解有偏差。
观察 delivery_gate 的闸门报告中,AI 痕迹、结构缺损被拦截的频率。
判定:初期拦截次数较多(Agent 通过自监控在学习和修正)。持续运行后,P1 类拦截次数应趋近于零——这表示前馈和积分控制已从源头消除了这些问题,不是闸门失效。
积分表中“已下沉”条目数 / “累计≥2次”条目总数的比率。
判定:比率应长期保持 100%。如果有条目 ≥2 次但长期未下沉,说明积分控制的自动下沉机制未触发,需要检查。
系统允许你根据自己的协作风格调整参数。
阈值默认 = 2。如果你:
- 对稳定性要求极高,希望极偶发反馈不扰动系统 → 调至 3
- 协作节奏很快,希望 Agent 更快学习你的偏好 → 保持 2 或调至 1(不推荐调至 1,会失去抗噪能力)
调整指令:
将积分控制表的触发阈值从 2 修改为 3。现在开始,同类反馈出现 ≥3 次才下沉。
随着你的需求变化,闸门的五关可以增减。
示例:你开始频繁要求输出纯 TXT 无头部,想增加一关:
在 delivery_gate 的第五关之后,增加第六关 [P2] 输出格式:检查是否为纯 TXT 且无头部信息。不通过则净化。
当你开始一个新任务类型,Agent 尚未有对应的 L3。
方法:完成几次该类型任务后,在“起飞”复盘时,Agent 会自动提议新增 L3 规律。你也可以直接说:
这是一个新任务类型:[名称]。请在本次任务完成后,为我提炼一条 L3 核心规律并存入记忆。
部署后的第一周,建议按以下节奏运行,让系统充分磨合。
| 天 | 动作 | 目的 |
|---|---|---|
| 第 1 天 | 完成部署(第五章),当天所有任务正常进行。观察前馈清单是否出现。 | 确认组件在线 |
| 第 2 天 | 正常任务。故意给一个相同类型的负面反馈两次,观察是否触发下沉。 | 验证积分控制 |
| 第 3 天 | 正常任务。说“起飞”,运行第一次真正意义的复盘。 | 验证闭环流程 |
| 第 4-5 天 | 正常使用,不做额外测试。 | 让系统积累数据 |
| 第 6 天 | 检查一次积分控制表状态,确认所有达阈值条目已下沉。 | 维护积分表 |
| 第 7 天 | 做一次完整的“起飞”复盘。检查画像 v1 是否需要更新到 v2。 | 形成周闭环 |
一周后,你基本能判断这套系统是否适合你的协作风格。如果觉得某部分过于繁琐(如每次任务都要确认清单),可以调整为“直接执行,仅在我说‘先列清单’时输出前馈”。
日常使用这套系统的要诀只有三个:
- 正常任务正常发,不要额外操作——前馈和闸门会自动工作。
- 有反馈时具体说——你说的每一句批评都会被积分表捕捉。
- 定期说“起飞”——这是系统自我进化的唯一按钮。
部署不是终点,而是系统开始自进化的起点。每一周、每一次复盘,它都会比上一周更“像”你。
下一章:常见问题与延伸思考。覆盖部署和运行中可能遇到的障碍,以及如何将这套框架延展到多角色、多 Agent 场景。