Skip to content

阅读路径

本页速览 按目标编排的论文阅读路线:路线 A 两小时快速入门精读 3-5 篇经典,路线 B 工程落地掌握 BatchNorm、Adam 与微调类论文,路线 C 研究进阶啃推导与综述。每篇给出推荐理由、阅读深度与配套站内页面,附阅读节奏建议。

阅读路径 ​

一句话定义:阅读路径是把"泛泛刷论文"变成"按目标读论文"的编排——先定目标是入门、落地还是研究,再选对应的文章清单与阅读深度,避免在 arXiv 的洪流里迷路。

一、先定目标,再选路线 ​

论文浩如烟海,读什么、读多深,完全取决于你的目标:

路线目标读什么深度要求
A 两小时快速入门建立直觉、能听懂讨论3-5 篇经典理解思想、记住机制
B 工程落地训练出可靠的模型训练配方、架构变体、微调类能复述关键设计,最好动手复现
C 做研究读懂推导、提出新想法原始推导、综述、一作复现能推导、能批判、能延伸

三条路线不是互斥的:A 是 B、C 的前置,B 中遇到的问题会把你推向 C。本页只是导航,对应论文的逐篇精读在经典论文精读,全局时间线见论文地图,最新动态见前沿进展,方法论问题(读不懂怎么办、如何做笔记)见阅读纪律与 FAQ。

二、路线 A:两小时快速入门 ​

目标是"读完心里有底"——知道深度学习最核心的几张脸长什么样。建议按时间顺序读,先"图"后"文":先读深度学习演进简史建立年代感,再从下面 5 篇里选读,其中前 4 篇是必选。

A1. LeNet(LeCun 1998)——热身 30 分钟 ​

推荐理由:最薄的入门书。它第一次完整给出"卷积 → 池化 → 全连接 → 反向传播训练"的现代 CNN 骨架,篇幅短、图表直观,几分钟就能看懂整体流程。 阅读深度:看架构图与训练流程,不必抠公式。 配套站内页:结构细节见CNN 与计算机视觉。

A2. AlexNet(Krizhevsky 2012)——精读 1-2 小时 ​

推荐理由:深度学习元年的大事件。它用"ReLU + Dropout + 数据增强 + 多 GPU + ImageNet 大样本"的组合把 ImageNet 错误率砍掉近一半,第一次证明"深度真的有用"。读它你会理解:深度学习是数据、算力、算法三要素的合谋。 阅读深度:重点读"为什么选 ReLU""为什么用 Dropout"和实验对比表。 配套站内页:激活函数与网络结构见神经网络基础。

A3. ResNet(He 2016)——精读 1-2 小时 ​

推荐理由:一句话贡献改变了一个领域——"加深网络不一定变差,残差连接让 152 层能训起来"。它引入了深度学习最通用的机制之一:恒等跳跃连接。今天所有大模型(Transformer 每一层)都长着 ResNet 的骨头。 阅读深度:吃透残差块的数学形式 $y = F(x) + x$ 与"为什么退化问题不是过拟合"这段分析。 配套站内页:网络深度与结构设计见CNN 与计算机视觉。

A4. Attention Is All You Need(Vaswani 2017)——精读 2-3 小时 ​

推荐理由:必读中的必读。Transformer 用自注意力取代循环,开启了大模型时代。读不懂没关系,先抓住三点:Q/K/V 是什么、为什么除以 $\sqrt{d_k}$、为什么自注意力可并行。 阅读深度:前 3.2 节公式值得逐行过一遍,其余章节浏览。 配套站内页:完整拆解见Transformer 架构,数学前置见注意力机制。

A5.(选读)BERT 或 GPT 论文——浏览 1 小时 ​

推荐理由:读一篇"Transformer 之后的预训练"代表作,看架构如何被训练目标激活。BERT 和 GPT 是同一个 Transformer 的两种用法,理解其中一篇即可理解另一篇。 阅读深度:浏览预训练任务与微调流程,不必读附录。 配套站内页:预训练与微调全景见表征学习与预训练,规模化后果见大语言模型(LLM)。

路线 A 验收标准

合上书,你能用一句话说出每篇论文"解决什么问题、核心方法是什么",并能向别人解释"为什么 ResNet 加一条短路就能训得更深"。达标即可进入路线 B。

三、路线 B:工程落地 ​

目标是"读得动、用得上"——把论文里验证过的训练配方变成你的默认操作。这组论文的共同特点是:读后第二天就能改进你的训练脚本。

B1. BatchNorm(Ioffe & Szegedy 2015)——精读 1-2 小时 ​

推荐理由:它让"大胆地用大学习率"成为可能。理解"对每个 mini-batch 在通道维度做归一化"为什么能稳定深层训练、为什么推理时改用全局统计量,是排错训练发散的前提。 配套站内页:与 LayerNorm 的对比选型见初始化与归一化。

B2. Adam(Kingma & Ba 2015)——精读 1-2 小时 ​

推荐理由:工业界默认优化器。读懂它的三个机制(动量、自适应学习率、偏差校正)后,你就明白"Adam 为什么默认好使、但有时不如 SGD+动量收敛到更好的平坦区"。 配套站内页:优化算法全景见优化与梯度下降。

B3. Transformer 变体:BERT / GPT 系——选读 2-3 小时 ​

推荐理由:从"一个架构"到"一套系统"。理解 Encoder/Decoder 之分、Pre-Norm/Post-Norm、位置编码的演变,能帮你在微调预训练模型时做出正确选择(比如哪些层冻结、用多长序列)。 配套站内页:微调与参数高效微调(LoRA 等)见大语言模型(LLM)。

B4. 微调与对齐类:InstructGPT / LoRA / RAG——选读 2-3 小时 ​

推荐理由:工程落地的重心已经从"从零训练"转向"微调/检索增强/对齐"。了解 RLHF 与 SFT 的分工、LoRA 为什么能省 99% 的可训练参数量、检索增强如何补事实性短板,是当前做 LLM 应用的必修课。 配套站内页:评估微调效果的完整方法论见深度学习评估与实验,训练配方总览见训练配方与调参。

B5.(贯穿)损失函数与正则化论文——零散精读 ​

推荐理由:交叉熵、标签平滑、Dropout、权重衰减的原始论文都很短,适合碎片时间读。理解"为什么 Dropout 等价于集成、标签平滑为何抑制过度自信",能让你不再把正则项当咒语。 配套站内页:见损失函数与输出层与过拟合与正则化。

路线 B 提醒

这类论文读完后,请务必对照训练配方与调参动手验证一次:改一行 BatchNorm 位置、换一个优化器,观察损失曲线。不亲手改过,等于没读。

四、路线 C:研究进阶 ​

目标是"读得深、说得清"——读懂推导、能批判、能复现、能提出自己的问题。适合准备读研、求职研究岗或纯粹想深挖的学习者。

C1. 数学推导类:反向传播、Adam、Scaling Laws ​

  • Rumelhart et al. 1986(反向传播):亲手推导三层网络的链式法则,理解"梯度从输出流向每一层"的机制。数学前置用数学基础速查补齐。
  • Adam 原始推导:逐行验证动量与二阶矩的偏差校正,体会"推导中的每个选择都有动机"。
  • Scaling Laws(Kaplan 2020 / Chinchilla 2022):理解幂律曲线怎么从拟合数据中来、compute-optimal 的意义。它把"模型该做多大"从玄学变成预算问题。
  • 注意力机制的两篇源头:Bahdanau 2015(注意力起源)与 Vaswani 2017(Transformer)。推荐自己把 Q/K/V 的矩阵维度手写一遍。

C2. 综述:站在巨人的肩膀上 ​

  • LeCun, Bengio, Hinton 2015《Deep Learning》(Nature 综述):三位奠基人的全景地图,信息密度极高,适合反复读;
  • 《Attention Is All You Need》之后:A Survey of Transformers(Lin et al. 2021)等综述适合快速了解变体谱系;
  • 生成模型综述:从 VAE 到 GAN 再到扩散模型的递进关系,见生成式模型与VAE 与 GAN。

C3. 一作复现:研究者的试金石 ​

选一篇中等体量的论文(如 ResNet 或 BERT 的简化版),在从零构建一个深度学习项目的框架下自己实现。复现能暴露你所有"以为自己懂了"的地方,其价值是任何笔记都无法替代的。

路线 C 建议

研究者最重要的能力不是"读得多"而是"问得刁"。每读一篇,都写下一个"如果……会怎样"的假设,并试着在经典论文精读的消融讨论里找灵感。

五、阅读节奏建议 ​

时间建议动作产出
第 1 天路线 A 的 2 篇两篇各 1 页笔记(问题/贡献/消融)
第 1 周完成路线 A 其余 + 路线 B 前 2 篇每篇 30 分钟精读 + 5 分钟复述
第 2-3 周路线 B 后 3 篇 + 一次动手复现改代码并对比指标
第 4 周起路线 C:推导 + 综述 + 复现每周 1 篇深读 + 1 个假设

节奏心法:单次专注 45 分钟比坐一下午有效;同一篇论文值得读三遍——第一遍抓结构,第二遍抠细节,第三遍带着批判重读。读不懂的放一晚上,第二天往往豁然开朗(方法详见阅读纪律与 FAQ)。

六、权衡与取舍 ​

  • 广度 vs 深度:路线 A 求广、C 求深。入门期追求广度,研究期必须放弃"什么都知道一点"的虚荣,扎进一个点。
  • 原始论文 vs 二手解读:博客和课程可以帮你"预习",但最后一定要回到原文——二手解读会丢失关键细节,甚至传错结论。
  • 经典 vs 前沿:80% 时间给经典(机制稳定、验证充分),20% 给前沿(见前沿进展)。倒过来会地基不稳。
  • 读 vs 做:读到"感觉自己懂了"是最危险的错觉。每读完一组论文,都强制自己做一次作品集项目式的实验,把理解变成代码。

延伸阅读 ​

参考资料 ​