Skip to content

Commit 3f8ca1b

Browse files
committed
docs: 按 D2L 风格润色 24.4-24.5、第 25/26 章与附录 A 标题
1 parent 8b3d0e9 commit 3f8ca1b

16 files changed

Lines changed: 31 additions & 31 deletions

File tree

docs/.vitepress/config.mjs

Lines changed: 15 additions & 15 deletions
Original file line numberDiff line numberDiff line change
@@ -1314,11 +1314,11 @@ const zhSidebar = {
13141314
link: '/chapter28_vla/embodied-intelligence/'
13151315
},
13161316
{
1317-
text: '24.4 图像生成怎样用强化学习对齐',
1317+
text: '24.4 图像生成的强化学习对齐',
13181318
link: '/chapter29_visual_generation/visual-generation-dancegrpo'
13191319
},
13201320
{
1321-
text: '24.5 视频为什么会前后矛盾',
1321+
text: '24.5 视频的时间一致性',
13221322
link: '/chapter29_visual_generation/video-generation-modern'
13231323
}
13241324
]
@@ -1334,23 +1334,23 @@ const zhSidebar = {
13341334
collapsed: false,
13351335
items: [
13361336
{
1337-
text: '25.1 奖励越高,任务为什么反而做坏',
1337+
text: '25.1 奖励与任务的背离',
13381338
link: '/chapter30_alignment_failures/classical-failures'
13391339
},
13401340
{
1341-
text: '25.2 如何判断 RLVR 提升是真的',
1341+
text: '25.2 RLVR 的假性提升',
13421342
link: '/chapter30_alignment_failures/modern-incidents'
13431343
},
13441344
{
1345-
text: '25.3 模型为什么会在特定条件下切换行为',
1345+
text: '25.3 潜伏行为与条件切换',
13461346
link: '/chapter30_alignment_failures/sleeper-and-faking'
13471347
},
13481348
{
1349-
text: '25.4 如何防止模型钻奖励漏洞',
1349+
text: '25.4 奖励漏洞的防御',
13501350
link: '/chapter30_alignment_failures/scaling-and-defenses'
13511351
},
13521352
{
1353-
text: '25.5 如何可信地评测强化学习模型',
1353+
text: '25.5 评测协议与可复现性',
13541354
link: '/chapter30_alignment_failures/rl-evaluation'
13551355
}
13561356
]
@@ -1360,19 +1360,19 @@ const zhSidebar = {
13601360
collapsed: false,
13611361
items: [
13621362
{
1363-
text: '26.1 模型怎样自己产生训练数据',
1363+
text: '26.1 自博弈与训练数据生成',
13641364
link: '/chapter32_selfplay/self-play-outlook/'
13651365
},
13661366
{
1367-
text: '26.2 新增算力应该花在哪里',
1367+
text: '26.2 训练时与测试时的规模扩展',
13681368
link: '/chapter32_selfplay/rl-scaling-outlook'
13691369
},
13701370
{
1371-
text: '26.3 多个 LLM 怎样共同学习',
1371+
text: '26.3 多智能体协同学习',
13721372
link: '/chapter32_selfplay/llm-multi-agent-rl/'
13731373
},
13741374
{
1375-
text: '26.4 LLM 怎样搜索新算法',
1375+
text: '26.4 LLM 驱动的算法搜索',
13761376
link: '/chapter32_selfplay/alphaevolve/'
13771377
}
13781378
]
@@ -1387,19 +1387,19 @@ const zhSidebar = {
13871387
collapsed: false,
13881388
items: [
13891389
{
1390-
text: 'A.1 训练为什么跑偏',
1390+
text: 'A.1 训练跑偏的症状',
13911391
link: '/appendix_industrial_training/training-debugging'
13921392
},
13931393
{
1394-
text: 'A.2 一批轨迹怎样变成一次更新',
1394+
text: 'A.2 从轨迹到策略更新',
13951395
link: '/appendix_industrial_training/rl-infrastructure'
13961396
},
13971397
{
1398-
text: 'A.3 Agent 为什么必须在沙箱里训练',
1398+
text: 'A.3 沙箱与 Agent 训练',
13991399
link: '/appendix_industrial_training/agentic-rl-infra'
14001400
},
14011401
{
1402-
text: 'A.4 怎样证明模型真的变好',
1402+
text: 'A.4 模型改进的评测验证',
14031403
link: '/appendix_industrial_training/evaluation-badcase'
14041404
}
14051405
]

docs/appendix_industrial_training/agentic-rl-infra.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# A.3 Agent 为什么必须在沙箱里训练:隔离、轨迹与调度
1+
# A.3 沙箱与 Agent 训练
22

33
设想一个代码修复 Agent。它收到仓库和问题描述,先读取源码,再修改文件并运行测试。一次探索中,Agent 发现删除一个本地测试文件后,公开测试仍然返回成功;另一次探索中,它读取了工作目录里的 `.env`,把其中的信息写进答案。两条轨迹都可能得到高奖励,但都没有完成真实任务。
44

docs/appendix_industrial_training/evaluation-badcase.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# A.4 怎样证明模型真的变好:评测基准与 Badcase 闭环
1+
# A.4 模型改进的评测验证
22

33
假设同一轮训练产生两个 checkpoint。A 的训练奖励是 0.82,私有任务成功率是 41%;B 的训练奖励只有 0.65,私有任务成功率却是 46%,平均工具调用成本也更低。若只按训练奖励选模型,系统会发布一个真实任务表现更差的版本。
44

docs/appendix_industrial_training/rl-infrastructure.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# A.2 一批轨迹怎样变成一次更新:RL 训练系统底座
1+
# A.2 从轨迹到策略更新
22

33
先看一个简化的 GRPO 训练例子。系统取 64 道题,每题生成 8 条回答,一共得到 512 条样本。假设生成耗时 45 秒,规则评分耗时 4 秒,参数更新耗时 12 秒。即使把反向传播加速一倍,整轮时间也只从 61 秒降到 55 秒;这组时间记录里的主要瓶颈是回答生成。
44

docs/appendix_industrial_training/training-debugging.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# A.1 训练为什么跑偏:从第一条异常曲线开始调试
1+
# A.1 训练跑偏的症状
22

33
先看一组很常见的训练记录。某个数学推理模型在第 800 步时,训练奖励从 0.18 升到 0.73;同一时间,固定评测集的正确率从 42% 降到 40%,平均回答长度却接近翻倍。程序没有报错,损失也能正常反向传播。只看训练奖励,这次实验似乎进展顺利;把评测和输出样本放在一起看,模型更可能学会了奖励函数偏爱的长格式。
44

docs/chapter29_visual_generation/video-generation-modern.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 24.5 视频为什么会前后矛盾:视频 RLHF 与物理评测
1+
# 24.5 视频的时间一致性
22

33
先想象一段只有四秒的视频。
44

docs/chapter29_visual_generation/visual-generation-dancegrpo.md

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 24.4 图像生成怎样用强化学习对齐:从 DDPO 到 DanceGRPO
1+
# 24.4 图像生成的强化学习对齐
22

33
先看一条很普通的生成指令:
44

@@ -418,7 +418,7 @@ DPOK 用带 KL 约束的强化学习微调扩散模型[^dpok],DRaFT 对可微
418418

419419
DDPO 完成了这项基础转换。PPO 风格的概率比、裁剪与 KL 约束让更新保持稳定。DanceGRPO 进一步把扩散与 rectified flow 统一到可计算概率的随机采样过程,并用同一条件下的一组结果估计相对优势。
420420

421-
最后,训练效果的上限取决于奖励。审美、文本对齐和人类偏好各自只覆盖“好图”的一部分。下一节 [24.5 视频为什么会前后矛盾:视频 RLHF 与物理评测](./video-generation-modern) 加入时间轴,讨论人物身份、动作顺序和物理因果怎样进入奖励与评测。
421+
最后,训练效果的上限取决于奖励。审美、文本对齐和人类偏好各自只覆盖“好图”的一部分。下一节 [24.5 视频的时间一致性](./video-generation-modern) 加入时间轴,讨论人物身份、动作顺序和物理因果怎样进入奖励与评测。
422422

423423
## 参考资料
424424

docs/chapter30_alignment_failures/classical-failures.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 25.1 奖励越高,任务为什么反而做坏:经典对齐失败
1+
# 25.1 奖励与任务的背离
22

33
前面的章节一直在训练策略获得更高奖励。现在我们检查一个更基础的问题:奖励升高以后,事情是否真的做得更好。
44

docs/chapter30_alignment_failures/modern-incidents.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 25.2 如何判断 RLVR 提升是真的:排除污染与验证器漏洞
1+
# 25.2 RLVR 的假性提升
22

33
MATH-500 是从公开数学竞赛题中整理出的 500 道测试题。每道题都有可以自动核对的最终答案,因此常被用来观察数学推理模型的表现。
44

docs/chapter30_alignment_failures/rl-evaluation.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 25.5 如何可信地评测强化学习模型:从 Benchmark 到 Harness
1+
# 25.5 评测协议与可复现性
22

33
同一个模型在同一批题上,可以得到两个不同分数。第一次用温度 `0`、每题生成一次、从最后一行抽取答案;第二次用温度 `0.8`、每题生成 16 次,再由验证器挑选最好答案。模型参数没有变化,评测协议已经改变了问题。
44

0 commit comments

Comments
 (0)