Skip to content

Commit 56ba3f7

Browse files
committed
fix: render chapter 3.7 terminology table
1 parent 5491e4a commit 56ba3f7

1 file changed

Lines changed: 2 additions & 4 deletions

File tree

docs/chapter03_mdp/algorithm-taxonomy.md

Lines changed: 2 additions & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -187,12 +187,12 @@ $$
187187
RL 和 Agentic RL 论文的标题里经常堆满缩写和黑话。下表列出最常见的术语及其含义,遇到时可以快速对照。
188188

189189
| 术语 | 全称 | 含义 |
190-
| ----------------------- | ------------------------------------------ | -------------------------------------------------------------------------------------------------- | ----------------------------------------------------- |
190+
| ----------------------- | ------------------------------------------ | -------------------------------------------------------------------------------------------------- |
191191
| **On-policy** || 训练数据由当前正在优化的策略亲自产生。数据用过一轮后通常丢弃。 |
192192
| **Off-policy** || 训练数据可以来自旧策略或其他来源,与当前优化的目标策略不同。数据可反复复用。 |
193193
| **Online RL** || 训练过程中智能体持续与环境交互,数据集不断增长。 |
194194
| **Offline RL** || 训练前数据集已固定,训练中不允许再与环境交互。 |
195-
| **Model-based** || 算法显式学习或使用环境模型(状态转移 $P(s' | s,a)$ 和奖励 $R(s,a)$),用模型做规划或生成模拟数据。 |
195+
| **Model-based** || 算法显式学习或使用环境模型(状态转移 $P(s' \mid s,a)$ 和奖励 $R(s,a)$),用模型做规划或生成模拟数据。 |
196196
| **Model-free** || 不学习环境模型,直接从交互数据中估计价值函数或策略。 |
197197
| **Actor-Critic** || 架构模式:Actor(策略网络)负责选动作,Critic(价值网络)负责评估动作好坏,两者协同训练。 |
198198
| **SAC** | Soft Actor-Critic | Off-policy 的 Actor-Critic 算法,通过最大熵正则化鼓励策略保持随机性,提升探索和鲁棒性。 |
@@ -210,8 +210,6 @@ RL 和 Agentic RL 论文的标题里经常堆满缩写和黑话。下表列出
210210

211211
## 参考文献
212212

213-
## 参考文献
214-
215213
[^sutton-barto]: Sutton, R. S., & Barto, A. G. (2018). _Reinforcement Learning: An Introduction_ (2nd ed.). MIT Press. 参见第 5.5、5.7、6.4、6.5 章关于 off-policy prediction、off-policy control、Sarsa 和 Q-learning 的讨论。MIT Press 页面:<https://mitpress.mit.edu/9780262039246/reinforcement-learning/>
216214

217215
[^watkins1992]: Watkins, C. J. C. H., & Dayan, P. (1992). Q-learning. _Machine Learning_, 8, 279-292. <https://www.gatsby.ucl.ac.uk/~dayan/papers/wd92.html>

0 commit comments

Comments
 (0)