外观
阅读路径
一句话定义:阅读路径是把"泛泛刷论文"变成"按目标读论文"的编排——先定目标是入门、落地还是研究,再选对应的文章清单与阅读深度,避免在 arXiv 的洪流里迷路。
一、先定目标,再选路线
论文浩如烟海,读什么、读多深,完全取决于你的目标:
| 路线 | 目标 | 读什么 | 深度要求 |
|---|---|---|---|
| A 两小时快速入门 | 建立直觉、能听懂讨论 | 3-5 篇经典 | 理解思想、记住机制 |
| B 工程落地 | 训练出可靠的模型 | 训练配方、架构变体、微调类 | 能复述关键设计,最好动手复现 |
| C 做研究 | 读懂推导、提出新想法 | 原始推导、综述、一作复现 | 能推导、能批判、能延伸 |
三条路线不是互斥的:A 是 B、C 的前置,B 中遇到的问题会把你推向 C。本页只是导航,对应论文的逐篇精读在经典论文精读,全局时间线见论文地图,最新动态见前沿进展,方法论问题(读不懂怎么办、如何做笔记)见阅读纪律与 FAQ。
二、路线 A:两小时快速入门
目标是"读完心里有底"——知道深度学习最核心的几张脸长什么样。建议按时间顺序读,先"图"后"文":先读深度学习演进简史建立年代感,再从下面 5 篇里选读,其中前 4 篇是必选。
A1. LeNet(LeCun 1998)——热身 30 分钟
推荐理由:最薄的入门书。它第一次完整给出"卷积 → 池化 → 全连接 → 反向传播训练"的现代 CNN 骨架,篇幅短、图表直观,几分钟就能看懂整体流程。 阅读深度:看架构图与训练流程,不必抠公式。 配套站内页:结构细节见CNN 与计算机视觉。
A2. AlexNet(Krizhevsky 2012)——精读 1-2 小时
推荐理由:深度学习元年的大事件。它用"ReLU + Dropout + 数据增强 + 多 GPU + ImageNet 大样本"的组合把 ImageNet 错误率砍掉近一半,第一次证明"深度真的有用"。读它你会理解:深度学习是数据、算力、算法三要素的合谋。 阅读深度:重点读"为什么选 ReLU""为什么用 Dropout"和实验对比表。 配套站内页:激活函数与网络结构见神经网络基础。
A3. ResNet(He 2016)——精读 1-2 小时
推荐理由:一句话贡献改变了一个领域——"加深网络不一定变差,残差连接让 152 层能训起来"。它引入了深度学习最通用的机制之一:恒等跳跃连接。今天所有大模型(Transformer 每一层)都长着 ResNet 的骨头。 阅读深度:吃透残差块的数学形式 $y = F(x) + x$ 与"为什么退化问题不是过拟合"这段分析。 配套站内页:网络深度与结构设计见CNN 与计算机视觉。
A4. Attention Is All You Need(Vaswani 2017)——精读 2-3 小时
推荐理由:必读中的必读。Transformer 用自注意力取代循环,开启了大模型时代。读不懂没关系,先抓住三点:Q/K/V 是什么、为什么除以 $\sqrt{d_k}$、为什么自注意力可并行。 阅读深度:前 3.2 节公式值得逐行过一遍,其余章节浏览。 配套站内页:完整拆解见Transformer 架构,数学前置见注意力机制。
A5.(选读)BERT 或 GPT 论文——浏览 1 小时
推荐理由:读一篇"Transformer 之后的预训练"代表作,看架构如何被训练目标激活。BERT 和 GPT 是同一个 Transformer 的两种用法,理解其中一篇即可理解另一篇。 阅读深度:浏览预训练任务与微调流程,不必读附录。 配套站内页:预训练与微调全景见表征学习与预训练,规模化后果见大语言模型(LLM)。
路线 A 验收标准
合上书,你能用一句话说出每篇论文"解决什么问题、核心方法是什么",并能向别人解释"为什么 ResNet 加一条短路就能训得更深"。达标即可进入路线 B。
三、路线 B:工程落地
目标是"读得动、用得上"——把论文里验证过的训练配方变成你的默认操作。这组论文的共同特点是:读后第二天就能改进你的训练脚本。
B1. BatchNorm(Ioffe & Szegedy 2015)——精读 1-2 小时
推荐理由:它让"大胆地用大学习率"成为可能。理解"对每个 mini-batch 在通道维度做归一化"为什么能稳定深层训练、为什么推理时改用全局统计量,是排错训练发散的前提。 配套站内页:与 LayerNorm 的对比选型见初始化与归一化。
B2. Adam(Kingma & Ba 2015)——精读 1-2 小时
推荐理由:工业界默认优化器。读懂它的三个机制(动量、自适应学习率、偏差校正)后,你就明白"Adam 为什么默认好使、但有时不如 SGD+动量收敛到更好的平坦区"。 配套站内页:优化算法全景见优化与梯度下降。
B3. Transformer 变体:BERT / GPT 系——选读 2-3 小时
推荐理由:从"一个架构"到"一套系统"。理解 Encoder/Decoder 之分、Pre-Norm/Post-Norm、位置编码的演变,能帮你在微调预训练模型时做出正确选择(比如哪些层冻结、用多长序列)。 配套站内页:微调与参数高效微调(LoRA 等)见大语言模型(LLM)。
B4. 微调与对齐类:InstructGPT / LoRA / RAG——选读 2-3 小时
推荐理由:工程落地的重心已经从"从零训练"转向"微调/检索增强/对齐"。了解 RLHF 与 SFT 的分工、LoRA 为什么能省 99% 的可训练参数量、检索增强如何补事实性短板,是当前做 LLM 应用的必修课。 配套站内页:评估微调效果的完整方法论见深度学习评估与实验,训练配方总览见训练配方与调参。
B5.(贯穿)损失函数与正则化论文——零散精读
推荐理由:交叉熵、标签平滑、Dropout、权重衰减的原始论文都很短,适合碎片时间读。理解"为什么 Dropout 等价于集成、标签平滑为何抑制过度自信",能让你不再把正则项当咒语。 配套站内页:见损失函数与输出层与过拟合与正则化。
路线 B 提醒
这类论文读完后,请务必对照训练配方与调参动手验证一次:改一行 BatchNorm 位置、换一个优化器,观察损失曲线。不亲手改过,等于没读。
四、路线 C:研究进阶
目标是"读得深、说得清"——读懂推导、能批判、能复现、能提出自己的问题。适合准备读研、求职研究岗或纯粹想深挖的学习者。
C1. 数学推导类:反向传播、Adam、Scaling Laws
- Rumelhart et al. 1986(反向传播):亲手推导三层网络的链式法则,理解"梯度从输出流向每一层"的机制。数学前置用数学基础速查补齐。
- Adam 原始推导:逐行验证动量与二阶矩的偏差校正,体会"推导中的每个选择都有动机"。
- Scaling Laws(Kaplan 2020 / Chinchilla 2022):理解幂律曲线怎么从拟合数据中来、compute-optimal 的意义。它把"模型该做多大"从玄学变成预算问题。
- 注意力机制的两篇源头:Bahdanau 2015(注意力起源)与 Vaswani 2017(Transformer)。推荐自己把 Q/K/V 的矩阵维度手写一遍。
C2. 综述:站在巨人的肩膀上
- LeCun, Bengio, Hinton 2015《Deep Learning》(Nature 综述):三位奠基人的全景地图,信息密度极高,适合反复读;
- 《Attention Is All You Need》之后:A Survey of Transformers(Lin et al. 2021)等综述适合快速了解变体谱系;
- 生成模型综述:从 VAE 到 GAN 再到扩散模型的递进关系,见生成式模型与VAE 与 GAN。
C3. 一作复现:研究者的试金石
选一篇中等体量的论文(如 ResNet 或 BERT 的简化版),在从零构建一个深度学习项目的框架下自己实现。复现能暴露你所有"以为自己懂了"的地方,其价值是任何笔记都无法替代的。
路线 C 建议
研究者最重要的能力不是"读得多"而是"问得刁"。每读一篇,都写下一个"如果……会怎样"的假设,并试着在经典论文精读的消融讨论里找灵感。
五、阅读节奏建议
| 时间 | 建议动作 | 产出 |
|---|---|---|
| 第 1 天 | 路线 A 的 2 篇 | 两篇各 1 页笔记(问题/贡献/消融) |
| 第 1 周 | 完成路线 A 其余 + 路线 B 前 2 篇 | 每篇 30 分钟精读 + 5 分钟复述 |
| 第 2-3 周 | 路线 B 后 3 篇 + 一次动手复现 | 改代码并对比指标 |
| 第 4 周起 | 路线 C:推导 + 综述 + 复现 | 每周 1 篇深读 + 1 个假设 |
节奏心法:单次专注 45 分钟比坐一下午有效;同一篇论文值得读三遍——第一遍抓结构,第二遍抠细节,第三遍带着批判重读。读不懂的放一晚上,第二天往往豁然开朗(方法详见阅读纪律与 FAQ)。
六、权衡与取舍
- 广度 vs 深度:路线 A 求广、C 求深。入门期追求广度,研究期必须放弃"什么都知道一点"的虚荣,扎进一个点。
- 原始论文 vs 二手解读:博客和课程可以帮你"预习",但最后一定要回到原文——二手解读会丢失关键细节,甚至传错结论。
- 经典 vs 前沿:80% 时间给经典(机制稳定、验证充分),20% 给前沿(见前沿进展)。倒过来会地基不稳。
- 读 vs 做:读到"感觉自己懂了"是最危险的错觉。每读完一组论文,都强制自己做一次作品集项目式的实验,把理解变成代码。
延伸阅读
- 学习路径:三条路线——全站整体学习路线,论文阅读在其中所处的位置
- 什么是深度学习——读论文前先建立的最小概念底座
- 深度学习演进简史——论文地图的时间线版本
- 术语表——读论文遇到生词先来这里
- 精选资源清单——论文仓库与阅读工具
参考资料
- LeCun, Bottou, Bengio, Haffner. Gradient-Based Learning Applied to Document Recognition (Proceedings of the IEEE 1998)
- Krizhevsky, Sutskever, Hinton. ImageNet Classification with Deep Convolutional Neural Networks (NeurIPS 2012)
- He, Zhang, Ren, Sun. Deep Residual Learning for Image Recognition (CVPR 2016)
- Vaswani et al. Attention Is All You Need (NeurIPS 2017)
- Ioffe, Szegedy. Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift (ICML 2015)
- Kingma, Ba. Adam: A Method for Stochastic Optimization (ICLR 2015)
- Kaplan et al. Scaling Laws for Neural Language Models (2020)
- Hoffmann et al. Training Compute-Optimal Large Language Models (Chinchilla) (NeurIPS 2022)