Skip to content

Commit a8ee72c

Browse files
committed
docs: 25.2 标题统一为假性收益,修正附录 A 的交叉引用
1 parent 2816b2a commit a8ee72c

7 files changed

Lines changed: 8 additions & 8 deletions

File tree

docs/.vitepress/config.mjs

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1338,7 +1338,7 @@ const zhSidebar = {
13381338
link: '/chapter30_alignment_failures/classical-failures'
13391339
},
13401340
{
1341-
text: '25.2 RLVR 的假性提升',
1341+
text: '25.2 RLVR 的假性收益',
13421342
link: '/chapter30_alignment_failures/modern-incidents'
13431343
},
13441344
{

docs/appendix_gpu_hours/gpu-hours-estimation.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -293,5 +293,5 @@ Qwen3 tech report 描述了复杂的 4 阶段后训练(含冷启动、RL、合
293293
下一步建议:
294294

295295
- **做入门实验**:参考 [附录 D 代码速查](../appendix_code_cheatsheet/sft-kl) 中的 GRPO/DPO 代码,在单卡上跑一遍。
296-
- **规划中型实验**:参考 [附录 B 工程实践](../appendix_industrial_training/training-debugging) 中的分布式训练与监控章节
296+
- **规划中型实验**:参考 [附录 A.1 训练跑偏](../appendix_industrial_training/training-debugging) 中的诊断顺序与排查清单
297297
- **阅读前沿论文的成本披露**:在 [附录 F](../appendix_paper_reading/learning-resources) 的 tech report 中寻找训练细节。

docs/chapter18_grpo/rl-environments.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -492,7 +492,7 @@ AReaL 论文报告,在 agentic 任务上对 Llama-3-8B 训练:
492492
- 极长任务(> 1 小时):异步是唯一可行方案
493493
:::
494494

495-
更深入的工程细节见[附录 B.1:RL 训练系统](../appendix_industrial_training/rl-infrastructure)
495+
更深入的工程细节见[附录 A.2 轨迹生成与策略更新](../appendix_industrial_training/rl-infrastructure)
496496

497497
## 评测基准
498498

docs/chapter22_agentic/industrial-evaluation.md

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -1015,7 +1015,7 @@ FRONTEND_HACKING_RULES = [
10151015

10161016
2. **构造任务。** 简单任务可以用 TaskCraft 式的自动化方法生成,中等难度任务用 Evol-Instruct 的进化操作逐步提升复杂度,困难任务用 HardGen 从失败 case 中反向合成。复杂任务也可以从真实用户需求中提取。每个任务标注验证类型:有确定答案的用精确匹配,可执行的用沙箱验证,开放式的用 JADE 式的动态 Rubric。
10171017

1018-
3. **去污染。** 确保评测集中的任务没有出现在训练数据中。可以用 n-gram 重叠或语义相似度检测泄露。这一步和[附录 B 的去污染方法](/appendix_industrial_training/evaluation-badcase)一致。
1018+
3. **去污染。** 确保评测集中的任务没有出现在训练数据中。可以用 n-gram 重叠或语义相似度检测泄露。这一步和[附录 A.4 的去污染方法](/appendix_industrial_training/evaluation-badcase)一致。
10191019

10201020
4. **用 ABC 清单审查。** 检查任务是否有歧义,评测方法是否高估或低估 Agent 能力,是否存在可以被钻空子的漏洞。
10211021

@@ -1167,7 +1167,7 @@ $$
11671167

11681168
**回归验证。** 重新跑 SWE-bench,确认两件事:通过率是否提升(预期从 35% 上升),之前通过的 case 是否退步。
11691169

1170-
这个闭环和[附录 B 的评测体系](/appendix_industrial_training/evaluation-badcase)一脉相承,只是从 LLM 评测扩展到了 Agent 评测。Agent 评测的特殊之处在于需要管理沙箱环境和工具执行状态,Pipeline 的工程复杂度更高。
1170+
这个闭环和[附录 A.4 的评测体系](/appendix_industrial_training/evaluation-badcase)一脉相承,只是从 LLM 评测扩展到了 Agent 评测。Agent 评测的特殊之处在于需要管理沙箱环境和工具执行状态,Pipeline 的工程复杂度更高。
11711171

11721172
<details>
11731173
<summary>思考题:如果你的 Agent 在 BFCL 上得了 95 分,但在 SWE-bench 上只有 15%,这说明什么?</summary>

docs/chapter24_deep_research/browser-rl-harness.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -394,7 +394,7 @@ Tongyi DeepResearch 的数据合成管线 [^tongyi_dr] 是其核心创新之一
394394

395395
## 第五层:先定义“好的研究”
396396

397-
> 本节聚焦 Deep Research 场景特有的评估维度。更广泛的 Agentic 评测体系(包括工具调用、端到端任务、综合能力的 benchmark 全景和评测系统搭建)见 [附录 A.4:评测基准](../appendix_industrial_training/evaluation-badcase)
397+
> 本节聚焦 Deep Research 场景特有的评估维度。更广泛的 Agentic 评测体系(包括工具调用、端到端任务、综合能力的 benchmark 全景和评测系统搭建)见 [附录 A.4 评估模型改进](../appendix_industrial_training/evaluation-badcase)
398398
399399
Deep Research Agent 的"好"远不止是最终答案的正确性。一个优秀的 Deep Research 结果需要同时满足四个层次:
400400

docs/chapter30_alignment_failures/modern-incidents.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,4 @@
1-
# 25.2 RLVR 的假性提升
1+
# 25.2 RLVR 的假性收益
22

33
MATH-500 是从公开数学竞赛题中整理出的 500 道测试题。每道题都有可以自动核对的最终答案,因此常被用来观察数学推理模型的表现。
44

docs/chapter30_alignment_failures/rl-evaluation.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -556,7 +556,7 @@ RL 评估方法论的核心原则:
556556
4. **保留独立测试**:训练奖励、开发集和最终报告集彼此隔离
557557
5. **版本化 Harness**:记录代码、任务、依赖、随机种子和推理预算
558558

559-
AI R&D 自动化评测说明,模型已经能够参与部分训练优化和控制任务;具体结论取决于 Harness、资源限制和评分方式。接下来可进入[附录 A.2 训练系统底座](../appendix_industrial_training/rl-infrastructure),了解如何在大规模集群上运行这些 RL 实验。
559+
AI R&D 自动化评测说明,模型已经能够参与部分训练优化和控制任务;具体结论取决于 Harness、资源限制和评分方式。接下来可进入[附录 A.2 轨迹生成与策略更新](../appendix_industrial_training/rl-infrastructure),了解如何在大规模集群上运行这些 RL 实验。
560560

561561
## 延伸阅读
562562

0 commit comments

Comments
 (0)