外观
论文地图
一句话定义:论文地图是把深度学习发展史上的关键论文,按主题与时间轴铺开的一张全景图——它回答"这领域从哪来、主线是什么、下一步往哪走",是精读任何一篇论文前的定位工具(时间线的通俗版见深度学习演进简史)。
一、如何阅读这张地图
- 横轴是时间:每篇论文都站在前人的肩膀上,按时间顺序读能看出"问题是如何被层层逼出来的";
- 纵轴是主题:视觉、序列、生成、效率、科学应用五条主线相对独立又彼此纠缠——比如 Transformer 先是序列模型,后来统治了视觉和生成;
- 配套使用:地图只给"一句话贡献",要深读请进入经典论文精读;要看最新动向跳到前沿进展;要按目标排阅读顺序用阅读路径。
一句话读懂论文史
深度学习的历史就是一个能力被不断放大的过程:单层感知机(1958)→ 多层反向传播(1986)→ 大规模 CNN(2012)→ 长程序列(2014-2017)→ 预训练大模型(2018-2020)→ 生成与对齐(2020-)。每走一步,靠的都是"更大数据 + 更强算力 + 更聪明的归纳偏置"三者的合力。
二、奠基时代:神经元、感知机与反向传播(1943-1989)
- 1943 · McCulloch & Pitts:用数学语言定义"形式神经元",把大脑计算抽象成可模拟的逻辑单元——神经网络理论的起点。
- 1958 · Rosenblatt 感知机:第一个"能学习"的模型,用简单的感知器规则从样本中自动学权重,掀起第一波神经网络热潮。它证实了一个朴素而深刻的机制:认知可以被分解为可学习的权重(感知机的基本结构见神经网络基础)。
- 1969 · Minsky & Papert《Perceptrons》:严格证明单层感知机连 XOR 都学不会,给第一波热潮泼了冷水,也把整个领域带入了寒冬——这段教训至今提醒我们"模型的表达能力有边界"。
- 1986 · Rumelhart, Hinton, Williams 反向传播:用链式法则让多层网络可训练,把"层数"从理论参数变成实际能力。它的机制(前向传播→损失→梯度回传)是今天一切训练的地基,推导详见反向传播与自动微分。
- 1998 · LeCun LeNet-5:第一次端到端组合"卷积+池化+全连接+反向传播",用于手写数字识别,银行实际使用多年——CNN 的骨架就此定型,解剖见CNN 与计算机视觉。
三、卷积时代:深度、宽度与训练稳定性(2012-2020)
- 2012 · AlexNet:深度学习元年。ReLU 缓解梯度消失、Dropout 防过拟合、多 GPU 撑大网络,在 ImageNet 上把 top-5 错误率从 26% 打到 15.3%。意义不在架构创新,而在验证"深+大+强算力"路线可行。
- 2015 · VGG / GoogLeNet:VGG 用统一的小卷积核(3×3)把网络推深到 16-19 层,证明"规整比花哨重要";GoogLeNet 的 Inception 则用多尺度并行拓宽视野。
- 2015 · BatchNorm:对每个 mini-batch 做归一化,让深层网络训练从"走钢丝"变成"走大路",深度学习从此敢用大学习率。与 LayerNorm 的取舍见初始化与归一化。
- 2016 · ResNet:残差连接让 152 层成为可能,ILSVRC 2015 冠军。它把"结构越深越差"的退化问题转化为"加一层至少不亏",机制被 Transformer 等所有后续架构继承。
- 2020 · ViT:把图像切成 patch 当 token,证明"纯 Transformer 也能赢 CNN"——卷积的归纳偏置被大规模预训练取代,视觉与语言的架构开始统一(见多模态模型)。
四、序列建模:从 LSTM 到注意力(1997-2017)
- 1997 · LSTM(Hochreiter & Schmidhuber):门控机制(遗忘门、输入门、输出门)解决长程依赖的梯度问题,统治序列建模近二十年,直到今天仍在语音、流式任务里发挥作用,详解见RNN 与序列建模。
- 2013 · Word2Vec:把词变成稠密向量,词与词的关系变成向量运算("国王-男人+女人≈女王")——"表征即一切"思想的第一次大规模验证。
- 2014 · Seq2Seq(Sutskever, Vinyals, Le):Encoder-Decoder 框架让神经网络第一次可以处理"不定长到不定长"的映射(机器翻译),为生成式模型铺路。
- 2015 · Bahdanau 注意力:让解码器在每一步"回头看"输入的不同部分——注意力机制诞生,直接种下了 Transformer 的种子,概念详见注意力机制。
五、注意力与大模型:Transformer 之后(2017-)
- 2017 · Attention Is All You Need:抛弃循环,纯自注意力并行建模序列。复杂度、并行度、扩展性的三重优势让它成为大模型时代的事实标准,解剖见Transformer 架构。
- 2018-2019 · ELMo / GPT / BERT:把"预训练+微调"变成主流范式。BERT 的双向掩码语言模型刷新一堆 NLP 榜单,GPT 则坚持自回归单向路线——两条路线之争,最终由 GPT 的"生成大一统"胜出。
- 2019 · GPT-2 / T5:GPT-2 证明"更大即更强",T5 把所有 NLP 任务统一成"text-to-text"。
- 2020 · GPT-3:175B 参数 + 上下文学习(few-shot prompting),第一次展示"不用微调、说句话就能用"的模型能力,大规模扩展法则见大语言模型(LLM)与表征学习与预训练。
- 2022-2023 · InstructGPT / Chinchilla / LLaMA / GPT-4:RLHF 让模型"说人话";Chinchilla 回答"多少数据配多少参数";LLaMA 开源重定义研究生态;GPT-4 走向多模态与工具。
六、生成式:从隐变量到扩散(2014-)
- 2014 · VAE:用"编码→采样→解码"学习数据的隐分布,生成式模型的"贝叶斯派"基石,见VAE 与 GAN。
- 2014 · GAN:生成器与判别器零和博弈,生成的图像一度"以假乱真"(StyleGAN 人脸),但训练不稳定、模式坍塌是终身之痛。
- 2020 · DDPM:前向逐步加噪、反向逐步去噪,训练稳定且多样性好,正式开启扩散时代,机制详见扩散模型与生成式 AI。
- 2022 · Stable Diffusion:把扩散放到潜空间(Latent Diffusion)+ 文本条件,让"文生图"在消费级显卡上跑起来。
- 2024 · Sora:扩散扩展到视频,展现对物理世界的一致性建模能力。生成式模型全家谱见生成式模型。
七、效率与优化:让大模型"用得动"(2015-)
- 2015 · Adam:动量+自适应学习率+偏差校正三合一,成为默认优化器,见优化与梯度下降。
- 2015 · 知识蒸馏(Hinton):让小模型学大模型的软标签,是模型压缩与"教师-学生"范式的源头。
- 2017-2021 · MoE(Shazeer 2017 / Switch Transformer 2021):稀疏专家路由,"激活一小部分参数干完所有活",DeepSeek-V3、Mixtral 等大模型用它把训练成本降一个数量级。
- 2022-2023 · FlashAttention / GPTQ / AWQ / 投机采样:注意力 IO 优化、4-bit 量化、推理加速,让百亿参数模型能在单卡甚至手机端运行,工程全景见MLOps 与模型部署。
八、科学应用:深度学习改变科学(2016-)
- 2016 · AlphaGo:深度强化学习第一次击败人类顶级棋手,见深度强化学习应用。
- 2021 · AlphaFold2:把蛋白质结构预测的精度从"不可能"推到实验级(CASP14 分数超过 90),两年预测出几乎所有已知蛋白结构。
- 2024 · AlphaFold3 / AlphaGeometry:从"预测结构"扩展到"蛋白质+配体复合物",数学奥林匹克级别的定理证明——"AI for Science"从口号变成日常。
九、综合表格
以下把上述论文按「年份 / 论文 / 主题 / 一句话贡献 / 关联站内页」汇总。关联站内页为纯文本指引,详细链接见正文各节:
| 年份 | 论文 | 主题 | 一句话贡献 | 关联站内页 |
|---|---|---|---|---|
| 1943 | McCulloch & Pitts | 奠基 | 用数学定义神经元,神经网络理论的起点 | 神经网络基础 |
| 1958 | Rosenblatt 感知机 | 奠基 | 第一个可学习的模型,掀起第一波热潮 | 神经网络基础 |
| 1969 | Minsky & Papert | 奠基 | 证明单层感知机局限,领域进入寒冬 | 神经网络基础 |
| 1986 | Rumelhart 反向传播 | 奠基 | 链式法则让多层网络可训练 | 反向传播与自动微分 |
| 1998 | LeNet-5 | 卷积 | 卷积+池化+全连接的 CNN 骨架定型 | CNN 与计算机视觉 |
| 2012 | AlexNet | 卷积 | 深度+大数据+强算力路线首次验证 | CNN 与计算机视觉 |
| 2015 | VGG | 卷积 | 统一小卷积核,网络规整化推深 | CNN 与计算机视觉 |
| 2015 | GoogLeNet | 卷积 | Inception 多尺度并行拓宽网络 | CNN 与计算机视觉 |
| 2015 | BatchNorm | 卷积 | 归一化稳定深层训练,敢用大学习率 | 初始化与归一化 |
| 2016 | ResNet | 卷积 | 残差连接让超深网络可训 | CNN 与计算机视觉 |
| 2020 | ViT | 卷积 | 图像 patch 化,Transformer 进军视觉 | 多模态模型 |
| 1997 | LSTM | 序列 | 门控解决长程依赖,统治序列建模二十年 | RNN 与序列建模 |
| 2013 | Word2Vec | 序列 | 词变稠密向量,表征学习里程碑 | 表征学习与预训练 |
| 2014 | Seq2Seq | 序列 | 不定长到不定长的映射框架 | RNN 与序列建模 |
| 2015 | Bahdanau Attention | 序列 | 注意力机制诞生,Transformer 的种子 | 注意力机制 |
| 2017 | Attention Is All You Need | 大模型 | 纯注意力并行建模,开启大模型时代 | Transformer 架构 |
| 2018 | ELMo / GPT-1 | 大模型 | 预训练+微调范式确立 | 表征学习与预训练 |
| 2019 | BERT | 大模型 | 双向掩码预训练刷新 NLP 榜单 | 大语言模型(LLM) |
| 2019 | GPT-2 / T5 | 大模型 | 更大即更强 / 一切任务统一为 text-to-text | 大语言模型(LLM) |
| 2020 | GPT-3 | 大模型 | 175B 参数,上下文学习出圈 | 大语言模型(LLM) |
| 2022 | InstructGPT / Chinchilla | 大模型 | RLHF 对齐 / 计算最优配比 | 大语言模型(LLM) |
| 2023 | LLaMA / GPT-4 | 大模型 | 开源生态 / 多模态与工具使用 | 多模态模型 |
| 2014 | VAE | 生成 | 隐变量+重参数化学习数据分布 | VAE 与 GAN |
| 2014 | GAN | 生成 | 生成器判别器对抗博弈 | VAE 与 GAN |
| 2019 | StyleGAN | 生成 | 可控高质量人脸生成 | VAE 与 GAN |
| 2020 | DDPM | 生成 | 加噪-去噪的扩散生成范式 | 扩散模型与生成式 AI |
| 2022 | Stable Diffusion | 生成 | 潜空间扩散+文本条件,文生图平民化 | 扩散模型与生成式 AI |
| 2024 | Sora | 生成 | 扩散扩展到长时视频 | 扩散模型与生成式 AI |
| 2015 | Adam | 效率 | 动量+自适应学习率默认优化器 | 优化与梯度下降 |
| 2015 | 知识蒸馏 | 效率 | 小模型学大模型软标签 | 优化与梯度下降 |
| 2017 | Sparsely-Gated MoE | 效率 | 稀疏专家路由,激活部分参数 | 大语言模型(LLM) |
| 2022 | FlashAttention | 效率 | IO 感知的注意力加速 | 大语言模型(LLM) |
| 2022-23 | GPTQ / AWQ / 投机采样 | 效率 | 量化与投机解码降低推理成本 | MLOps 与模型部署 |
| 2016 | AlphaGo | 科学应用 | 深度 RL 击败人类棋手 | 深度强化学习应用 |
| 2021 | AlphaFold2 | 科学应用 | 蛋白质结构预测达实验级 | 深度强化学习应用 |
| 2024 | AlphaFold3 / AlphaGeometry | 科学应用 | 复合物结构 / 奥数级定理证明 | 深度强化学习应用 |
十、权衡与取舍
- 地图≠知识:看地图能快速定位,但"一句话贡献"会掩盖大量细节与失败——比如 ResNet 的成功建立在 VGG 的深度教训之上,脱离上下文的一句话会失真。
- 主线 vs 支线:这张地图突出了七条主流线,但强化学习(AlphaGo 之外还有推荐、控制)、图神经网络、语音等支线同样重要,可去对应栏目深挖。
- 历史视角的局限:所有地图都带着"事后诸葛亮"的滤镜。读的时候要记得:当年没人知道哪篇会封神,很多当时被忽视的论文(如 Transformer 早期、RNN 早期的批判)后来被反复重新发现。
- 别背地图:地图的价值是"定位"而非"记忆"。遇到陌生模型时,问一句"它在哪条主线上、继承了什么、挑战了什么",就够用了。
延伸阅读
- 经典论文精读——地图上最重要论文的逐篇深读
- 阅读路径——按目标(入门/落地/研究)排的阅读顺序
- 前沿进展——地图的"最新一页"
- 阅读纪律与 FAQ——读论文的方法论
- 深度学习演进简史——同一段历史的时间线版
- 什么是深度学习——地图之外的领域定位
参考资料
- McCulloch, Pitts. A Logical Calculus of the Ideas Immanent in Nervous Activity (1943)
- Rumelhart, Hinton, Williams. Learning representations by back-propagating errors (Nature 1986)
- LeCun et al. Gradient-Based Learning Applied to Document Recognition (Proceedings of the IEEE 1998)
- Krizhevsky, Sutskever, Hinton. ImageNet Classification with Deep Convolutional Neural Networks (NeurIPS 2012)
- He et al. Deep Residual Learning for Image Recognition (CVPR 2016)
- Hochreiter, Schmidhuber. Long Short-Term Memory (Neural Computation 1997)
- Sutskever, Vinyals, Le. Sequence to Sequence Learning with Neural Networks (NeurIPS 2014)
- Bahdanau, Cho, Bengio. Neural Machine Translation by Jointly Learning to Align and Translate (ICLR 2015)
- Vaswani et al. Attention Is All You Need (NeurIPS 2017)
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers (NAACL 2019)
- Brown et al. Language Models are Few-Shot Learners (NeurIPS 2020)
- Goodfellow et al. Generative Adversarial Nets (NeurIPS 2014)
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models (NeurIPS 2020)
- Jumper et al. Highly accurate protein structure prediction with AlphaFold (Nature 2021)
- Silver et al. Mastering the game of Go with deep neural networks and tree search (Nature 2016)