← 返回主目录
本书的核心公式是 Agent = LLM + 上下文 + 工具。第 1 章从三个层次解释同一个 Agent:实现层是这条公式,直觉层是「大脑 + 眼睛 + 手脚」,学术层则对应策略(Policy)、观察空间(Observation Space)与动作空间(Action Space)。
| 组件 | 比喻 | 职责 |
|---|---|---|
| 🧠 LLM | 大脑 | 提供理解、推理和决策能力 |
| 👁️ 上下文(Context) | 眼睛 | Agent 在每个决策点能看到的全部信息:系统提示词、工具定义、用户消息、模型回复、工具执行结果 |
| 🤲 工具(Tools) | 手脚 | 感知环境、执行操作、与外部世界交互 |
进入生产环境后,第 1 章把同一个系统改写为 Agent = Model + Harness,其中 Harness = 上下文管理 + 工具接口 + 约束 + 验证 + 纠正。后三项正是能跑的 Demo 与可靠产品之间的差距所在。
《导言》给出的整体安排是:第 1–6 章建立完整的 Agent 构建方法,第 7–10 章从评估、后训练、持续进化和多 Agent 协作四个方向讨论能力提升。每章附带一条关键洞察:
| 部分 | 章 | 覆盖内容 | 关键洞察 |
|---|---|---|---|
| 构建 | 第 1 章 | Agent 三要素、ReAct 循环、编排模式(工作流与自主)、Harness 工程 | 能跑的 Demo 与可靠产品之间的差距在 Harness,不在模型 |
| 第 2 章 | API 消息结构、KV Cache、提示工程与提示注入攻防、Agent Skills、Agent 状态栏、上下文压缩 | 全书最关键的一章;上下文决定能力上限,前缀越稳定缓存命中越高 | |
| 第 3 章 | 用户记忆的四种渐进式策略、RAG 技术栈、知识的组织与检索、Agentic RAG、多模态记忆 | 把上下文从单次会话延伸为跨会话积累的持久知识 | |
| 第 4 章 | 五类工具(感知/执行/协作/事件触发/用户沟通)、MCP、通用设计原则、主动工具发现 | 感知工具控信息量,执行工具控风险;工具设计应通用化 | |
| 第 5 章 | Coding Agent 加文件系统、OpenClaw 架构、代码作为元能力的六个方向 | 代码不只是写程序,而是能在运行时创造新工具的元能力 | |
| 第 6 章 | 模态 × 时序两个维度:异步与事件驱动、语音、Computer Use、机器人操作 | 四类交互共享同一批系统原语:唤醒、安全点、取消、抢占、快慢路径分离 | |
| 提升 | 第 7 章 | 评估环境、指标体系、数据集设计、LLM-as-a-Judge、统计显著性、可观测性、仿真环境 | 没有评估,就分不清「设计带来的提升」和「随机波动」 |
| 第 8 章 | 四阶段全景、Mid-training/SFT/RL、奖励设计、多轮信用分配、蒸馏 | SFT 记忆、RL 泛化;数据与环境比算法更重要 | |
| 第 9 章 | 学习信号(环境结果/过程规则/LLM Rubric)、知识/指令/程序/参数四种更新载体、灰度与回滚 | 更新载体取决于能力如何被表达与验证 | |
| 第 10 章 | 分类框架(上下文共享或独立 × 对等/管理者/去中心化)、A2A 协议、六种失败模式、Agent 社会 | 多 Agent 的每个设计决策都能在单 Agent 三要素中找到对应 |
正文不是某个 SDK 的逐步教程。正文中的短伪代码和 skeleton 只回答“状态怎样流动、哪一步可以停止、哪类信号参与验证”;章级实验则提供完整实现、模型/环境适配、测试、日志和证据。阅读实验时不需要理解每个文件的每一行,也不应把一次实验的具体 API 写法当成通用架构。
建议按下面三层阅读,遇到复杂章节可以在同一层选择多个机制实验,而不是只跑一个项目:
| 层级 | 先看什么 | 暂时可以跳过什么 | 适合的问题 |
|---|---|---|---|
| Starter | 项目 README 的目标、最小命令、验收条件;正文对应 skeleton | 凭据加载、UI、provider adapter、长篇原始日志 | “这个实验要证明哪条机制?” |
| Builder | 入口函数、核心循环、状态/消息 schema、工具和验证器 | 与机制无关的兼容层、部署脚本 | “哪一个变量改变了行为?” |
| Maintainer | 测试、失败处理、证据格式、manifest/hash、回滚路径 | 只有在改动实验时才需要的第三方源码细节 | “结果是否可复核,失败是否被诚实记录?” |
各章 README 已经标出自己的 Starter 入口,推荐的第一批是:第 1 章 context,第 2 章 context-compression,第 3 章 user-memory,第 4 章 execution-tools,第 5 章 coding-agent,第 6 章 live-audio,第 7 章 tau2-bench-eval,第 8 章 cot-distillation,第 9 章 trajectory-verifier,第 10 章 parallel-web-research。每个目录的 Code map 会标出 Run first、Core behavior、Verifier 和首次阅读可跳过的部分。
| 级别 | 章 | 适合读者 |
|---|---|---|
| 🟢 入门级 | 第 1–2 章 | 初学者;只需 Python 基础和 LLM 使用经验 |
| 🔵 进阶级 | 第 3–4 章 | 有一定编程基础,涉及检索系统与工具集成 |
| 🟣 高级 | 第 5–6 章 | 较强编程能力,涉及复杂系统设计;第 6 章建议了解 HTTP/WebSocket |
| 🟡 工程级 | 第 7 章 | 评估基础设施与统计方法,重工程实践,数学要求不高 |
| 🔴 专家级 | 第 8 章 | 全书唯一需要机器学习与模型训练经验的一章 |
| 🟠 应用级 | 第 9–10 章 | 综合运用前面所学,构建持续进化闭环与多 Agent 系统 |
正文中的实验和思考题另有星级标注:★ 入门级,适合所有读者;★★ 需要一定工程实践基础;★★★ 进阶挑战,通常涉及开放性问题或复杂的系统设计。
| # | 建议 | 说明 |
|---|---|---|
| 1 | 🛠️ 动手实践 | 每个项目都设计为可独立运行,建议亲自运行并修改代码 |
| 2 | 📚 结合书籍 | 配合 book/ 中相应章节阅读,理解理论与实践的结合 |
| 3 | 🔬 实验对比 | 多个项目包含消融研究和对比实验,通过对比加深理解 |
| 4 | 🪜 渐进学习 | 从简单项目开始,逐步深入复杂系统 |
| 5 | 🔌 关注协议 | 第 4 章的 MCP 工具项目展示了标准化工具协议,这是构建可扩展 Agent 的关键 |