Skip to content

Latest commit

 

History

History
232 lines (150 loc) · 10.4 KB

File metadata and controls

232 lines (150 loc) · 10.4 KB

第六章:日常使用与验证

部署完成后,本章回答两个问题:每天怎么用这套系统,以及怎么知道它在正常运行


6.1 日常协作的新节奏

部署后,你和 Agent 的协作模式会发生一个微妙但重要的变化——你从“纠错者”切换为“确认者”。

阶段 以前的发生顺序 现在的发生顺序
启动 你发任务 → Agent 直接做 你发任务 → Agent 输出启动清单 → 你确认(或说“直接做”) → 开始
执行 Agent 输出 → 你检查 → 你纠正 Agent 按 Skill 执行,自动注入避坑项
交付 你检查 → 发现套话/格式问题 → 你说 → 它改 Agent 自动过五关闸门 → 你拿到的是干净结果
反馈 你说一句 → 它有时改过头有时没记住 你说一句 → 它记录到积分表,第二次才改规则
复盘 你凭感觉总结 你说“起飞” → Agent 自动跑九步复盘

核心变化:以前你在回路里充当反馈控制器,现在大部分反馈回路被 Agent 内化成了前馈和自监控。


6.2 典型使用场景与对话示例

场景 A:开启新任务

你说

帮我写一篇关于“秋日最后一天”的短篇,2000字左右。

Agent 自动执行(无需额外指令):

  1. 调用 feedforward_startup
  2. 输出如下启动清单:
启动清单
任务类型:短篇创作
场景规律 L3:情绪定调优先于情节,结尾留白不升华
用户原则 L2:冷感叙事,拒绝 AI 总结;简洁不堆形容词
历史教训:上次“画面感不足”,本次加强环境白描
风险预判:
- P0:字数偏离过远
- P1:结尾不自觉总结
- P2:对话占比过高导致叙述单薄
避坑清单:开篇建立画面,结尾自然收束不点题;全程冷感,不堆形容词。

(等待确认或说“直接做”)

你说

直接做

Agent:开始写作,并在交付前自动过 delivery_gate

如果任务特别简单(如“帮我翻译一段话”),前馈清单也应简化,不强制长篇大论。你可以随时说“跳过清单直接做”。


场景 B:给出负面反馈

你说

这次结尾又总结了一句“秋天终将过去”,我不喜欢。

Agent 内部自动执行(你不需要额外指令):

  1. 归类:A类(违反 L2 审美原则)
  2. 在积分控制表中查找:若已有“结尾AI总结”条目,次数+1;若无,新建。
  3. 判断:
    • 次数=1 → 仅修正本次,回复:“已记录,本次已修正。”
    • 次数=2 → 自动触发下沉,回复:“‘结尾AI总结’已出现2次,我将此规则下沉至 L2 审美原则:‘拒绝任何形式的总结式收束’。是否同意?”

你的反馈越具体(如“结尾啰嗦”),Agent 越容易抽象为精确的错误模式。避免模糊反馈如“写得不好”。


场景 C:每日/每周复盘

你说

起飞

Agent 自动调用 control_loop_review,按九步流程输出,最后你会看到类似:

[闭环梳理完成]

- 前馈审查:本周 feedforward 5次,均正常调用
- 积分下沉:1项已下沉(结尾AI总结 → L2)
- 层级净化:无混淆
- 闸门升级:建议在P1中增加“连续对话段落不超过6行”检查项,是否同意?
- 根因分析:略...
- 可复用提炼:建议创建 skill: dialogue_density_check
- 迁移提议:本轮无需(或:建议引入香农信息论控制对话密度)

你逐条确认/否决后,Agent 写入记忆并调用画像维护。


场景 D:系统状态随时查询

你说

你现在记忆分几层?分别存什么?

Agent 应准确回答 L1 五条、L2 维度、L3 场景列表、积分表条目数。

你说

积分控制表现在有哪些条目?

Agent 输出当前表状态。


6.3 系统健康检查清单

每周花 2 分钟过一遍以下清单,确保系统没有悄悄退化。

自检项(你只需观察,无需额外指令)

# 检查点 正常表现 异常信号
1 前馈启动 每次新任务 Agent 都输出启动清单 Agent 直接开始执行,跳过了清单
2 交付质量 交付物干净,无 AI 套话,格式正确 你又看到“综上所述”“值得注意的是”
3 积分控制 同类问题你提第二次时,Agent 提出下沉 第三次你还得纠正同一问题
4 层级分离 memory 里没有操作步骤,skill 里没有原则 某次你打开记忆发现里面塞满了步骤
5 闭环执行 说“起飞”后 Agent 跑完整九步 复盘输出敷衍、跳过根因分析

快速修复指令

如果某个检查点异常,用对应指令快速修复:

  • 前馈失效 → 以后每次任务前强制调用 feedforward_startup。
  • 积分失效 → 请查看积分控制表,并确认所有 ≥2 次条目是否已下沉。
  • 层级混淆 → 做一次层级净化扫描。
  • 闸门松懈 → 重新执行一次完整的 delivery_gate 流程,并汇报结果。

6.4 验证系统正常运行的核心指标

以下四个定量指标可以帮助你判断系统是否真正生效(可偶尔观察,不必每日统计):

指标 1:重复纠正率

旧模式:同类问题你平均需要纠正 3-5 次才不再犯。 新模式(启用积分控制后):同类问题第 2 次出现即下沉,第 3 次起不应再出现。

判定:如果某个已下沉问题出现了第 3 次,说明下沉执行失败或 Skill 未被更新,需要启动闭环排查。

指标 2:前馈清单命中率

Agent 输出的启动清单中,P1 风险预判是否经常被你确认“对,就是这个”。

判定:前馈清单中至少 50% 以上的 P1 预判属于你确实在意的点,则前馈系统运行良好。若连续 5 次任务 P1 全被你说“不对”,说明 L2/L3 需要更新或 Agent 对你的理解有偏差。

指标 3:交付前拦截次数

观察 delivery_gate 的闸门报告中,AI 痕迹、结构缺损被拦截的频率。

判定:初期拦截次数较多(Agent 通过自监控在学习和修正)。持续运行后,P1 类拦截次数应趋近于零——这表示前馈和积分控制已从源头消除了这些问题,不是闸门失效。

指标 4:积分表下沉转化率

积分表中“已下沉”条目数 / “累计≥2次”条目总数的比率。

判定:比率应长期保持 100%。如果有条目 ≥2 次但长期未下沉,说明积分控制的自动下沉机制未触发,需要检查。


6.5 调整阈值和配置

系统允许你根据自己的协作风格调整参数。

6.5.1 调整积分阈值

阈值默认 = 2。如果你:

  • 对稳定性要求极高,希望极偶发反馈不扰动系统 → 调至 3
  • 协作节奏很快,希望 Agent 更快学习你的偏好 → 保持 2 或调至 1(不推荐调至 1,会失去抗噪能力)

调整指令

将积分控制表的触发阈值从 2 修改为 3。现在开始,同类反馈出现 ≥3 次才下沉。

6.5.2 调整闸门检查项

随着你的需求变化,闸门的五关可以增减。

示例:你开始频繁要求输出纯 TXT 无头部,想增加一关:

在 delivery_gate 的第五关之后,增加第六关 [P2] 输出格式:检查是否为纯 TXT 且无头部信息。不通过则净化。

6.5.3 新增场景的 L3 规律

当你开始一个新任务类型,Agent 尚未有对应的 L3。

方法:完成几次该类型任务后,在“起飞”复盘时,Agent 会自动提议新增 L3 规律。你也可以直接说:

这是一个新任务类型:[名称]。请在本次任务完成后,为我提炼一条 L3 核心规律并存入记忆。

6.6 第一周运行建议

部署后的第一周,建议按以下节奏运行,让系统充分磨合。

动作 目的
第 1 天 完成部署(第五章),当天所有任务正常进行。观察前馈清单是否出现。 确认组件在线
第 2 天 正常任务。故意给一个相同类型的负面反馈两次,观察是否触发下沉。 验证积分控制
第 3 天 正常任务。说“起飞”,运行第一次真正意义的复盘。 验证闭环流程
第 4-5 天 正常使用,不做额外测试。 让系统积累数据
第 6 天 检查一次积分控制表状态,确认所有达阈值条目已下沉。 维护积分表
第 7 天 做一次完整的“起飞”复盘。检查画像 v1 是否需要更新到 v2。 形成周闭环

一周后,你基本能判断这套系统是否适合你的协作风格。如果觉得某部分过于繁琐(如每次任务都要确认清单),可以调整为“直接执行,仅在我说‘先列清单’时输出前馈”。


6.7 本章总结

日常使用这套系统的要诀只有三个:

  1. 正常任务正常发,不要额外操作——前馈和闸门会自动工作。
  2. 有反馈时具体说——你说的每一句批评都会被积分表捕捉。
  3. 定期说“起飞”——这是系统自我进化的唯一按钮。

部署不是终点,而是系统开始自进化的起点。每一周、每一次复盘,它都会比上一周更“像”你。


下一章:常见问题与延伸思考。覆盖部署和运行中可能遇到的障碍,以及如何将这套框架延展到多角色、多 Agent 场景。