用 llm-math-foundations 的数学基础,带你逐篇精读 LLM 领域的经典论文。
以数学为锚点 :每篇论文的学习都关联到 llm-math-foundations 中的数学知识
Step by Step 教学 :不是论文翻译,而是真正的教学——有引导、有提问、有代码验证
多维度阅读 :每篇论文提供独立讲解 + 论文原文融合讲解两种模式
本仓库所有论文教程均基于四层递进法 组织(融合了李沐三步法、Keshav Three-Pass Method、LLM 面试需求)。
🔍 第一层:鸟瞰(10-15 分钟)— "这篇论文在说什么?"
步骤
内容
输出
读标题 + 摘要
一句话总结这篇论文的核心贡献
1 句话
读引言最后一段
作者自己说的 contribution
3-5 个要点
读结论
最终结论 + 局限性
总结
浏览所有图表
看懂 figure/table 的标题和趋势
每张图一句话
看参考文献
圈出你认识的论文 → 定位这篇在知识网络中的位置
参考文献图谱
判断 :这篇论文值不值得继续读?对面试有多重要?
📖 第二层:精读(1-2 小时)— "这篇论文怎么做的?"
步骤
内容
关键问题
引言逐段精读
问题描述 → 已有方法的不足 → 本文的创新
为什么现有方法不够好?
方法逐节精读
每个模块做什么、公式推导不跳步
为什么这样设计?直觉是什么?
输入→输出追踪
数据怎么流入模型、每一步怎么变换、最终输出什么
能画出一个完整的数据流图吗?
实验精读
每个实验验证了什么假设?消融实验每个变体改了什么?
如果去掉某组件会怎样?
图表精读
不看描述,先自己解读图表,再对照 caption
我读出的信息和作者说的一致吗?
输出 :能用自己的话复述整篇论文的技术路线,画图说明。
🧠 第三层:批判性思考(30-60 分钟)— "如果是我,我会怎么做?"
维度
问题
问题本身
这个问题重要吗?是真正的问题还是伪需求?
方法选择
为什么用这个方法而不是另一个?如果用 BERT 的方式做会怎样?
设计决策
每个超参数/设计选择的理由是什么?有更好的选择吗?
实验设计
实验是否充分?有没有遗漏的对比?结果是否 convincingly 支持了 claim?
局限性
论文自己承认的局限是什么?我没看到的局限是什么?
复现性
我能复现吗?需要什么资源?最关键的超参数是什么?
改进空间
如果我继续这个方向,下一步做什么?
输出 :能给别人讲清楚这篇论文,并能回答深入追问。
🔗 第四层:知识网络(30 分钟)— "这篇论文在更大图景中的位置"
维度
内容
纵向(时间线)
之前有什么 → 本文做了什么 → 之后有什么改进
横向(同期对比)
同时期其他团队怎么解决类似问题?各自的优劣?
与已有知识关联
关联到 llm-math-foundations 的哪些章节?关联到之前读过的哪些论文?
面试连接
面试官会怎么问这篇论文?怎么用这篇论文的内容回答面试题?
#
论文
年份
核心主题
面试重要度
状态
02
BERT
2018
双向预训练编码器
⭐⭐⭐⭐⭐
✅ 完成(四层递进法重写)
03
GPT-2
2019
自回归语言模型
⭐⭐⭐⭐
✅ 完成
#
论文
年份
核心主题
面试重要度
状态
04
GPT-3
2020
Few-shot / In-context Learning
⭐⭐⭐⭐⭐
✅ 完成
05
Chinchilla
2022
Scaling Laws / 计算最优
⭐⭐⭐⭐
✅ 完成
#
论文
年份
核心主题
面试重要度
状态
06
InstructGPT
2022
RLHF 对齐
⭐⭐⭐⭐⭐
✅ 完成
07
LLaMA
2023
开源基座模型
⭐⭐⭐⭐
✅ 完成
#
论文
年份
核心主题
面试重要度
状态
08
LoRA
2021
参数高效微调
⭐⭐⭐⭐⭐
✅ 完成
#
论文
年份
核心主题
面试重要度
状态
A1
DeepSeek-V3
2024
MoE + MLA + FP8 训练
⭐⭐⭐⭐⭐
✅ 完成
A2
DeepSeek-R1
2025
纯 RL 推理能力
⭐⭐⭐⭐⭐
✅ 完成
A3
DFlash
2026
Block Diffusion 投机解码
⭐⭐⭐⭐
✅ 完成
重点理解 :MLM(Masked Language Model)为什么能实现双向编码?与 GPT 的单向有什么本质区别?
面试常问 :BERT 的预训练任务(MLM + NSP)、[CLS] token 的作用、为什么 NSP 后续被 RoBERTa 证明没必要
关联 :和 GPT-2 对比阅读,理解编码器 vs 解码器路线的分歧
重点理解 :自回归语言模型如何统一所有 NLP 任务(不需要监督微调)
面试常问 :GPT-2 的 zero-shot 方式、scaling 的核心论点(更大模型 = 更强能力)
关联 :衔接 GPT-3 的 few-shot learning
重点理解 :In-context Learning 的本质——模型在不更新参数的情况下学习新任务
面试常问 :few-shot vs zero-shot vs fine-tuning 的区别、GPT-3 的规模和训练细节
注意 :论文很长(72页),重点读 Section 2-3(方法+评估),附录可略读
重点理解 :数据量 vs 模型大小的最优比例(约 20:1 的 token 数与参数量之比)
面试常问 :为什么 LLaMA 能用小模型打赢大模型?Chinchilla 最优意味着什么?
关联 :你 CS336 学的 scaling laws 可以直接关联
重点理解 :RLHF 三步流程(SFT → Reward Model → PPO)的每一步为什么需要
面试常问 :PPO 在 RLHF 中具体怎么用?Reward Model 怎么训练?什么是 reward hacking?
关联 :你的 llm-math-foundations Ch09 有 PPO 推导,可以互相印证
重点理解 :Chinchilla 最优的实践验证——更多数据 + 更小模型的策略
面试常问 :训练数据配方(各来源占比)、RoPE、SwiGLU、RMSNorm 等结构改进
注意 :论文比较工程化,重点在训练细节和 scaling 实验
重点理解 :为什么低秩分解有效?ΔW = AB 的直觉
面试常问 :LoRA 的 rank 通常设多少?为什么可以很小?与全量微调的效果差距?
注意 :论文短且精,建议精读,公式推导要吃透
重点理解 :MLA(Multi-head Latent Attention)如何压缩 KV Cache、MoE 的细粒度专家设计
面试常问 :为什么 MLA 比 MHA 省?负载均衡怎么做?
注意 :技术报告很长,重点读架构设计和训练方案
重点理解 :纯 RL(不用 SFT)就能涌现 CoT 推理能力
面试常问 :R1-Zero 和 R1 的区别、蒸馏 vs RL 的效果对比
注意 :这是 2025 年最热的论文之一,面试加分利器
重点理解 :为什么 block diffusion 比 autoregressive drafting 快?KV Injection vs Input Fusion 的区别?
面试常问 :投机解码的加速公式、DFlash 的两个创新点(并行 drafting + KV injection)、为什么 diffusion 适合做 draft 不适合做生成
关联 :与 DeepSeek-V3 的 MTP 互补(都是多 token 预测,但方式不同);与 LoRA 的 adapter 思想类似
注意 :2026 ICML 论文,小米 MiMo-V2.5-UltraSpeed 的底层技术,工业落地案例
papers/XX-paper-name/
├── paper.pdf # ① 论文原始 PDF
├── raw-extract.md # ② MinerU 转换的 Markdown + 图片
├── images/ # ② 提取的论文图片
├── README.md # ③ 独立中文讲解教程
├── merged-tutorial.md # ④ 论文原文 + 讲解融合版(边看边学)
└── figures-analysis.md # 图表分析(工作文件)
四种阅读方式 :
#
文件
适合场景
①
paper.pdf
原始论文,引用参考
②
raw-extract.md
论文 Markdown 版,方便搜索/引用
③
README.md
纯讲解版,系统学习时使用
④
merged-tutorial.md
边看论文边听讲解,沉浸式精读
详见 WORKFLOW.md — 添加新论文时按流程执行即可。