Skip to content

CCODING04/llm-paper-tutorials

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

51 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

📚 LLM 论文精读教程

llm-math-foundations 的数学基础,带你逐篇精读 LLM 领域的经典论文。

🎯 项目目标

  1. 以数学为锚点:每篇论文的学习都关联到 llm-math-foundations 中的数学知识
  2. Step by Step 教学:不是论文翻译,而是真正的教学——有引导、有提问、有代码验证
  3. 多维度阅读:每篇论文提供独立讲解 + 论文原文融合讲解两种模式

📖 论文阅读框架:四层递进法

本仓库所有论文教程均基于四层递进法组织(融合了李沐三步法、Keshav Three-Pass Method、LLM 面试需求)。

🔍 第一层:鸟瞰(10-15 分钟)— "这篇论文在说什么?"

步骤 内容 输出
读标题 + 摘要 一句话总结这篇论文的核心贡献 1 句话
读引言最后一段 作者自己说的 contribution 3-5 个要点
读结论 最终结论 + 局限性 总结
浏览所有图表 看懂 figure/table 的标题和趋势 每张图一句话
看参考文献 圈出你认识的论文 → 定位这篇在知识网络中的位置 参考文献图谱

判断:这篇论文值不值得继续读?对面试有多重要?

📖 第二层:精读(1-2 小时)— "这篇论文怎么做的?"

步骤 内容 关键问题
引言逐段精读 问题描述 → 已有方法的不足 → 本文的创新 为什么现有方法不够好?
方法逐节精读 每个模块做什么、公式推导不跳步 为什么这样设计?直觉是什么?
输入→输出追踪 数据怎么流入模型、每一步怎么变换、最终输出什么 能画出一个完整的数据流图吗?
实验精读 每个实验验证了什么假设?消融实验每个变体改了什么? 如果去掉某组件会怎样?
图表精读 不看描述,先自己解读图表,再对照 caption 我读出的信息和作者说的一致吗?

输出:能用自己的话复述整篇论文的技术路线,画图说明。

🧠 第三层:批判性思考(30-60 分钟)— "如果是我,我会怎么做?"

维度 问题
问题本身 这个问题重要吗?是真正的问题还是伪需求?
方法选择 为什么用这个方法而不是另一个?如果用 BERT 的方式做会怎样?
设计决策 每个超参数/设计选择的理由是什么?有更好的选择吗?
实验设计 实验是否充分?有没有遗漏的对比?结果是否 convincingly 支持了 claim?
局限性 论文自己承认的局限是什么?我没看到的局限是什么?
复现性 我能复现吗?需要什么资源?最关键的超参数是什么?
改进空间 如果我继续这个方向,下一步做什么?

输出:能给别人讲清楚这篇论文,并能回答深入追问。

🔗 第四层:知识网络(30 分钟)— "这篇论文在更大图景中的位置"

维度 内容
纵向(时间线) 之前有什么 → 本文做了什么 → 之后有什么改进
横向(同期对比) 同时期其他团队怎么解决类似问题?各自的优劣?
与已有知识关联 关联到 llm-math-foundations 的哪些章节?关联到之前读过的哪些论文?
面试连接 面试官会怎么问这篇论文?怎么用这篇论文的内容回答面试题?

📖 论文列表

第一阶段:基础架构

# 论文 年份 核心主题 状态
01 Attention Is All You Need 2017 Transformer 架构 ✅ 完成

第二阶段:预训练范式

# 论文 年份 核心主题 面试重要度 状态
02 BERT 2018 双向预训练编码器 ⭐⭐⭐⭐⭐ ✅ 完成(四层递进法重写)
03 GPT-2 2019 自回归语言模型 ⭐⭐⭐⭐ ✅ 完成

第三阶段:规模化突破

# 论文 年份 核心主题 面试重要度 状态
04 GPT-3 2020 Few-shot / In-context Learning ⭐⭐⭐⭐⭐ ✅ 完成
05 Chinchilla 2022 Scaling Laws / 计算最优 ⭐⭐⭐⭐ ✅ 完成

第四阶段:对齐与对话

# 论文 年份 核心主题 面试重要度 状态
06 InstructGPT 2022 RLHF 对齐 ⭐⭐⭐⭐⭐ ✅ 完成
07 LLaMA 2023 开源基座模型 ⭐⭐⭐⭐ ✅ 完成

第五阶段:效率优化

# 论文 年份 核心主题 面试重要度 状态
08 LoRA 2021 参数高效微调 ⭐⭐⭐⭐⭐ ✅ 完成

🇨🇳 附加:国产前沿论文

# 论文 年份 核心主题 面试重要度 状态
A1 DeepSeek-V3 2024 MoE + MLA + FP8 训练 ⭐⭐⭐⭐⭐ ✅ 完成
A2 DeepSeek-R1 2025 纯 RL 推理能力 ⭐⭐⭐⭐⭐ ✅ 完成
A3 DFlash 2026 Block Diffusion 投机解码 ⭐⭐⭐⭐ ✅ 完成

📝 各论文阅读注意事项

02 - BERT

  • 重点理解:MLM(Masked Language Model)为什么能实现双向编码?与 GPT 的单向有什么本质区别?
  • 面试常问:BERT 的预训练任务(MLM + NSP)、[CLS] token 的作用、为什么 NSP 后续被 RoBERTa 证明没必要
  • 关联:和 GPT-2 对比阅读,理解编码器 vs 解码器路线的分歧

03 - GPT-2

  • 重点理解:自回归语言模型如何统一所有 NLP 任务(不需要监督微调)
  • 面试常问:GPT-2 的 zero-shot 方式、scaling 的核心论点(更大模型 = 更强能力)
  • 关联:衔接 GPT-3 的 few-shot learning

04 - GPT-3

  • 重点理解:In-context Learning 的本质——模型在不更新参数的情况下学习新任务
  • 面试常问:few-shot vs zero-shot vs fine-tuning 的区别、GPT-3 的规模和训练细节
  • 注意:论文很长(72页),重点读 Section 2-3(方法+评估),附录可略读

05 - Chinchilla

  • 重点理解:数据量 vs 模型大小的最优比例(约 20:1 的 token 数与参数量之比)
  • 面试常问:为什么 LLaMA 能用小模型打赢大模型?Chinchilla 最优意味着什么?
  • 关联:你 CS336 学的 scaling laws 可以直接关联

06 - InstructGPT

  • 重点理解:RLHF 三步流程(SFT → Reward Model → PPO)的每一步为什么需要
  • 面试常问:PPO 在 RLHF 中具体怎么用?Reward Model 怎么训练?什么是 reward hacking?
  • 关联:你的 llm-math-foundations Ch09 有 PPO 推导,可以互相印证

07 - LLaMA

  • 重点理解:Chinchilla 最优的实践验证——更多数据 + 更小模型的策略
  • 面试常问:训练数据配方(各来源占比)、RoPE、SwiGLU、RMSNorm 等结构改进
  • 注意:论文比较工程化,重点在训练细节和 scaling 实验

08 - LoRA

  • 重点理解:为什么低秩分解有效?ΔW = AB 的直觉
  • 面试常问:LoRA 的 rank 通常设多少?为什么可以很小?与全量微调的效果差距?
  • 注意:论文短且精,建议精读,公式推导要吃透

A1 - DeepSeek-V3

  • 重点理解:MLA(Multi-head Latent Attention)如何压缩 KV Cache、MoE 的细粒度专家设计
  • 面试常问:为什么 MLA 比 MHA 省?负载均衡怎么做?
  • 注意:技术报告很长,重点读架构设计和训练方案

A2 - DeepSeek-R1

  • 重点理解:纯 RL(不用 SFT)就能涌现 CoT 推理能力
  • 面试常问:R1-Zero 和 R1 的区别、蒸馏 vs RL 的效果对比
  • 注意:这是 2025 年最热的论文之一,面试加分利器

A3 - DFlash

  • 重点理解:为什么 block diffusion 比 autoregressive drafting 快?KV Injection vs Input Fusion 的区别?
  • 面试常问:投机解码的加速公式、DFlash 的两个创新点(并行 drafting + KV injection)、为什么 diffusion 适合做 draft 不适合做生成
  • 关联:与 DeepSeek-V3 的 MTP 互补(都是多 token 预测,但方式不同);与 LoRA 的 adapter 思想类似
  • 注意:2026 ICML 论文,小米 MiMo-V2.5-UltraSpeed 的底层技术,工业落地案例

📂 每篇论文的文件结构

papers/XX-paper-name/
├── paper.pdf              # ① 论文原始 PDF
├── raw-extract.md         # ② MinerU 转换的 Markdown + 图片
├── images/                # ② 提取的论文图片
├── README.md              # ③ 独立中文讲解教程
├── merged-tutorial.md     # ④ 论文原文 + 讲解融合版(边看边学)
└── figures-analysis.md    # 图表分析(工作文件)

四种阅读方式

# 文件 适合场景
paper.pdf 原始论文,引用参考
raw-extract.md 论文 Markdown 版,方便搜索/引用
README.md 纯讲解版,系统学习时使用
merged-tutorial.md 边看论文边听讲解,沉浸式精读

🔗 关联资源

🤖 教程生成流程

详见 WORKFLOW.md — 添加新论文时按流程执行即可。

About

📚 LLM 论文精读教程 — 用数学基础带你逐篇精读经典论文

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors