File tree Expand file tree Collapse file tree
chapter30_alignment_failures Expand file tree Collapse file tree Original file line number Diff line number Diff line change @@ -1338,7 +1338,7 @@ const zhSidebar = {
13381338 link : '/chapter30_alignment_failures/classical-failures'
13391339 } ,
13401340 {
1341- text : '25.2 RLVR 的假性提升 ' ,
1341+ text : '25.2 RLVR 的假性收益 ' ,
13421342 link : '/chapter30_alignment_failures/modern-incidents'
13431343 } ,
13441344 {
Original file line number Diff line number Diff line change @@ -293,5 +293,5 @@ Qwen3 tech report 描述了复杂的 4 阶段后训练(含冷启动、RL、合
293293下一步建议:
294294
295295- ** 做入门实验** :参考 [ 附录 D 代码速查] ( ../appendix_code_cheatsheet/sft-kl ) 中的 GRPO/DPO 代码,在单卡上跑一遍。
296- - ** 规划中型实验** :参考 [ 附录 B 工程实践 ] ( ../appendix_industrial_training/training-debugging ) 中的分布式训练与监控章节 。
296+ - ** 规划中型实验** :参考 [ 附录 A.1 训练跑偏 ] ( ../appendix_industrial_training/training-debugging ) 中的诊断顺序与排查清单 。
297297- ** 阅读前沿论文的成本披露** :在 [ 附录 F] ( ../appendix_paper_reading/learning-resources ) 的 tech report 中寻找训练细节。
Original file line number Diff line number Diff line change @@ -492,7 +492,7 @@ AReaL 论文报告,在 agentic 任务上对 Llama-3-8B 训练:
492492- 极长任务(> 1 小时):异步是唯一可行方案
493493 :::
494494
495- 更深入的工程细节见[ 附录 B.1:RL 训练系统 ] ( ../appendix_industrial_training/rl-infrastructure ) 。
495+ 更深入的工程细节见[ 附录 A.2 轨迹生成与策略更新 ] ( ../appendix_industrial_training/rl-infrastructure ) 。
496496
497497## 评测基准
498498
Original file line number Diff line number Diff line change @@ -1015,7 +1015,7 @@ FRONTEND_HACKING_RULES = [
10151015
101610162 . ** 构造任务。** 简单任务可以用 TaskCraft 式的自动化方法生成,中等难度任务用 Evol-Instruct 的进化操作逐步提升复杂度,困难任务用 HardGen 从失败 case 中反向合成。复杂任务也可以从真实用户需求中提取。每个任务标注验证类型:有确定答案的用精确匹配,可执行的用沙箱验证,开放式的用 JADE 式的动态 Rubric。
10171017
1018- 3 . ** 去污染。** 确保评测集中的任务没有出现在训练数据中。可以用 n-gram 重叠或语义相似度检测泄露。这一步和[ 附录 B 的去污染方法] ( /appendix_industrial_training/evaluation-badcase ) 一致。
1018+ 3 . ** 去污染。** 确保评测集中的任务没有出现在训练数据中。可以用 n-gram 重叠或语义相似度检测泄露。这一步和[ 附录 A.4 的去污染方法] ( /appendix_industrial_training/evaluation-badcase ) 一致。
10191019
102010204 . ** 用 ABC 清单审查。** 检查任务是否有歧义,评测方法是否高估或低估 Agent 能力,是否存在可以被钻空子的漏洞。
10211021
11671167
11681168** 回归验证。** 重新跑 SWE-bench,确认两件事:通过率是否提升(预期从 35% 上升),之前通过的 case 是否退步。
11691169
1170- 这个闭环和[ 附录 B 的评测体系] ( /appendix_industrial_training/evaluation-badcase ) 一脉相承,只是从 LLM 评测扩展到了 Agent 评测。Agent 评测的特殊之处在于需要管理沙箱环境和工具执行状态,Pipeline 的工程复杂度更高。
1170+ 这个闭环和[ 附录 A.4 的评测体系] ( /appendix_industrial_training/evaluation-badcase ) 一脉相承,只是从 LLM 评测扩展到了 Agent 评测。Agent 评测的特殊之处在于需要管理沙箱环境和工具执行状态,Pipeline 的工程复杂度更高。
11711171
11721172<details >
11731173<summary >思考题:如果你的 Agent 在 BFCL 上得了 95 分,但在 SWE-bench 上只有 15%,这说明什么?</summary >
Original file line number Diff line number Diff line change @@ -394,7 +394,7 @@ Tongyi DeepResearch 的数据合成管线 [^tongyi_dr] 是其核心创新之一
394394
395395## 第五层:先定义“好的研究”
396396
397- > 本节聚焦 Deep Research 场景特有的评估维度。更广泛的 Agentic 评测体系(包括工具调用、端到端任务、综合能力的 benchmark 全景和评测系统搭建)见 [ 附录 A.4:评测基准 ] ( ../appendix_industrial_training/evaluation-badcase ) 。
397+ > 本节聚焦 Deep Research 场景特有的评估维度。更广泛的 Agentic 评测体系(包括工具调用、端到端任务、综合能力的 benchmark 全景和评测系统搭建)见 [ 附录 A.4 评估模型改进 ] ( ../appendix_industrial_training/evaluation-badcase ) 。
398398
399399Deep Research Agent 的"好"远不止是最终答案的正确性。一个优秀的 Deep Research 结果需要同时满足四个层次:
400400
Original file line number Diff line number Diff line change 1- # 25.2 RLVR 的假性提升
1+ # 25.2 RLVR 的假性收益
22
33MATH-500 是从公开数学竞赛题中整理出的 500 道测试题。每道题都有可以自动核对的最终答案,因此常被用来观察数学推理模型的表现。
44
Original file line number Diff line number Diff line change @@ -556,7 +556,7 @@ RL 评估方法论的核心原则:
5565564 . ** 保留独立测试** :训练奖励、开发集和最终报告集彼此隔离
5575575 . ** 版本化 Harness** :记录代码、任务、依赖、随机种子和推理预算
558558
559- AI R&D 自动化评测说明,模型已经能够参与部分训练优化和控制任务;具体结论取决于 Harness、资源限制和评分方式。接下来可进入[ 附录 A.2 训练系统底座 ] ( ../appendix_industrial_training/rl-infrastructure ) ,了解如何在大规模集群上运行这些 RL 实验。
559+ AI R&D 自动化评测说明,模型已经能够参与部分训练优化和控制任务;具体结论取决于 Harness、资源限制和评分方式。接下来可进入[ 附录 A.2 轨迹生成与策略更新 ] ( ../appendix_industrial_training/rl-infrastructure ) ,了解如何在大规模集群上运行这些 RL 实验。
560560
561561## 延伸阅读
562562
You can’t perform that action at this time.
0 commit comments