Skip to content

论文地图

本页速览 把深度学习六十年关键论文按主题与时间轴排成一张地图:奠基时代、卷积时代、序列建模、注意力与大模型、生成式、效率与优化、科学应用。每篇论文一句话贡献,配综合表格(年份/论文/主题/贡献/关联站内页)。

论文地图 ​

一句话定义:论文地图是把深度学习发展史上的关键论文,按主题与时间轴铺开的一张全景图——它回答"这领域从哪来、主线是什么、下一步往哪走",是精读任何一篇论文前的定位工具(时间线的通俗版见深度学习演进简史)。

一、如何阅读这张地图 ​

  • 横轴是时间:每篇论文都站在前人的肩膀上,按时间顺序读能看出"问题是如何被层层逼出来的";
  • 纵轴是主题:视觉、序列、生成、效率、科学应用五条主线相对独立又彼此纠缠——比如 Transformer 先是序列模型,后来统治了视觉和生成;
  • 配套使用:地图只给"一句话贡献",要深读请进入经典论文精读;要看最新动向跳到前沿进展;要按目标排阅读顺序用阅读路径。

一句话读懂论文史

深度学习的历史就是一个能力被不断放大的过程:单层感知机(1958)→ 多层反向传播(1986)→ 大规模 CNN(2012)→ 长程序列(2014-2017)→ 预训练大模型(2018-2020)→ 生成与对齐(2020-)。每走一步,靠的都是"更大数据 + 更强算力 + 更聪明的归纳偏置"三者的合力。

二、奠基时代:神经元、感知机与反向传播(1943-1989) ​

  • 1943 · McCulloch & Pitts:用数学语言定义"形式神经元",把大脑计算抽象成可模拟的逻辑单元——神经网络理论的起点。
  • 1958 · Rosenblatt 感知机:第一个"能学习"的模型,用简单的感知器规则从样本中自动学权重,掀起第一波神经网络热潮。它证实了一个朴素而深刻的机制:认知可以被分解为可学习的权重(感知机的基本结构见神经网络基础)。
  • 1969 · Minsky & Papert《Perceptrons》:严格证明单层感知机连 XOR 都学不会,给第一波热潮泼了冷水,也把整个领域带入了寒冬——这段教训至今提醒我们"模型的表达能力有边界"。
  • 1986 · Rumelhart, Hinton, Williams 反向传播:用链式法则让多层网络可训练,把"层数"从理论参数变成实际能力。它的机制(前向传播→损失→梯度回传)是今天一切训练的地基,推导详见反向传播与自动微分。
  • 1998 · LeCun LeNet-5:第一次端到端组合"卷积+池化+全连接+反向传播",用于手写数字识别,银行实际使用多年——CNN 的骨架就此定型,解剖见CNN 与计算机视觉。

三、卷积时代:深度、宽度与训练稳定性(2012-2020) ​

  • 2012 · AlexNet:深度学习元年。ReLU 缓解梯度消失、Dropout 防过拟合、多 GPU 撑大网络,在 ImageNet 上把 top-5 错误率从 26% 打到 15.3%。意义不在架构创新,而在验证"深+大+强算力"路线可行。
  • 2015 · VGG / GoogLeNet:VGG 用统一的小卷积核(3×3)把网络推深到 16-19 层,证明"规整比花哨重要";GoogLeNet 的 Inception 则用多尺度并行拓宽视野。
  • 2015 · BatchNorm:对每个 mini-batch 做归一化,让深层网络训练从"走钢丝"变成"走大路",深度学习从此敢用大学习率。与 LayerNorm 的取舍见初始化与归一化。
  • 2016 · ResNet:残差连接让 152 层成为可能,ILSVRC 2015 冠军。它把"结构越深越差"的退化问题转化为"加一层至少不亏",机制被 Transformer 等所有后续架构继承。
  • 2020 · ViT:把图像切成 patch 当 token,证明"纯 Transformer 也能赢 CNN"——卷积的归纳偏置被大规模预训练取代,视觉与语言的架构开始统一(见多模态模型)。

四、序列建模:从 LSTM 到注意力(1997-2017) ​

  • 1997 · LSTM(Hochreiter & Schmidhuber):门控机制(遗忘门、输入门、输出门)解决长程依赖的梯度问题,统治序列建模近二十年,直到今天仍在语音、流式任务里发挥作用,详解见RNN 与序列建模。
  • 2013 · Word2Vec:把词变成稠密向量,词与词的关系变成向量运算("国王-男人+女人≈女王")——"表征即一切"思想的第一次大规模验证。
  • 2014 · Seq2Seq(Sutskever, Vinyals, Le):Encoder-Decoder 框架让神经网络第一次可以处理"不定长到不定长"的映射(机器翻译),为生成式模型铺路。
  • 2015 · Bahdanau 注意力:让解码器在每一步"回头看"输入的不同部分——注意力机制诞生,直接种下了 Transformer 的种子,概念详见注意力机制。

五、注意力与大模型:Transformer 之后(2017-) ​

  • 2017 · Attention Is All You Need:抛弃循环,纯自注意力并行建模序列。复杂度、并行度、扩展性的三重优势让它成为大模型时代的事实标准,解剖见Transformer 架构。
  • 2018-2019 · ELMo / GPT / BERT:把"预训练+微调"变成主流范式。BERT 的双向掩码语言模型刷新一堆 NLP 榜单,GPT 则坚持自回归单向路线——两条路线之争,最终由 GPT 的"生成大一统"胜出。
  • 2019 · GPT-2 / T5:GPT-2 证明"更大即更强",T5 把所有 NLP 任务统一成"text-to-text"。
  • 2020 · GPT-3:175B 参数 + 上下文学习(few-shot prompting),第一次展示"不用微调、说句话就能用"的模型能力,大规模扩展法则见大语言模型(LLM)与表征学习与预训练。
  • 2022-2023 · InstructGPT / Chinchilla / LLaMA / GPT-4:RLHF 让模型"说人话";Chinchilla 回答"多少数据配多少参数";LLaMA 开源重定义研究生态;GPT-4 走向多模态与工具。

六、生成式:从隐变量到扩散(2014-) ​

  • 2014 · VAE:用"编码→采样→解码"学习数据的隐分布,生成式模型的"贝叶斯派"基石,见VAE 与 GAN。
  • 2014 · GAN:生成器与判别器零和博弈,生成的图像一度"以假乱真"(StyleGAN 人脸),但训练不稳定、模式坍塌是终身之痛。
  • 2020 · DDPM:前向逐步加噪、反向逐步去噪,训练稳定且多样性好,正式开启扩散时代,机制详见扩散模型与生成式 AI。
  • 2022 · Stable Diffusion:把扩散放到潜空间(Latent Diffusion)+ 文本条件,让"文生图"在消费级显卡上跑起来。
  • 2024 · Sora:扩散扩展到视频,展现对物理世界的一致性建模能力。生成式模型全家谱见生成式模型。

七、效率与优化:让大模型"用得动"(2015-) ​

  • 2015 · Adam:动量+自适应学习率+偏差校正三合一,成为默认优化器,见优化与梯度下降。
  • 2015 · 知识蒸馏(Hinton):让小模型学大模型的软标签,是模型压缩与"教师-学生"范式的源头。
  • 2017-2021 · MoE(Shazeer 2017 / Switch Transformer 2021):稀疏专家路由,"激活一小部分参数干完所有活",DeepSeek-V3、Mixtral 等大模型用它把训练成本降一个数量级。
  • 2022-2023 · FlashAttention / GPTQ / AWQ / 投机采样:注意力 IO 优化、4-bit 量化、推理加速,让百亿参数模型能在单卡甚至手机端运行,工程全景见MLOps 与模型部署。

八、科学应用:深度学习改变科学(2016-) ​

  • 2016 · AlphaGo:深度强化学习第一次击败人类顶级棋手,见深度强化学习应用。
  • 2021 · AlphaFold2:把蛋白质结构预测的精度从"不可能"推到实验级(CASP14 分数超过 90),两年预测出几乎所有已知蛋白结构。
  • 2024 · AlphaFold3 / AlphaGeometry:从"预测结构"扩展到"蛋白质+配体复合物",数学奥林匹克级别的定理证明——"AI for Science"从口号变成日常。

九、综合表格 ​

以下把上述论文按「年份 / 论文 / 主题 / 一句话贡献 / 关联站内页」汇总。关联站内页为纯文本指引,详细链接见正文各节:

年份论文主题一句话贡献关联站内页
1943McCulloch & Pitts奠基用数学定义神经元,神经网络理论的起点神经网络基础
1958Rosenblatt 感知机奠基第一个可学习的模型,掀起第一波热潮神经网络基础
1969Minsky & Papert奠基证明单层感知机局限,领域进入寒冬神经网络基础
1986Rumelhart 反向传播奠基链式法则让多层网络可训练反向传播与自动微分
1998LeNet-5卷积卷积+池化+全连接的 CNN 骨架定型CNN 与计算机视觉
2012AlexNet卷积深度+大数据+强算力路线首次验证CNN 与计算机视觉
2015VGG卷积统一小卷积核,网络规整化推深CNN 与计算机视觉
2015GoogLeNet卷积Inception 多尺度并行拓宽网络CNN 与计算机视觉
2015BatchNorm卷积归一化稳定深层训练,敢用大学习率初始化与归一化
2016ResNet卷积残差连接让超深网络可训CNN 与计算机视觉
2020ViT卷积图像 patch 化,Transformer 进军视觉多模态模型
1997LSTM序列门控解决长程依赖,统治序列建模二十年RNN 与序列建模
2013Word2Vec序列词变稠密向量,表征学习里程碑表征学习与预训练
2014Seq2Seq序列不定长到不定长的映射框架RNN 与序列建模
2015Bahdanau Attention序列注意力机制诞生,Transformer 的种子注意力机制
2017Attention Is All You Need大模型纯注意力并行建模,开启大模型时代Transformer 架构
2018ELMo / GPT-1大模型预训练+微调范式确立表征学习与预训练
2019BERT大模型双向掩码预训练刷新 NLP 榜单大语言模型(LLM)
2019GPT-2 / T5大模型更大即更强 / 一切任务统一为 text-to-text大语言模型(LLM)
2020GPT-3大模型175B 参数,上下文学习出圈大语言模型(LLM)
2022InstructGPT / Chinchilla大模型RLHF 对齐 / 计算最优配比大语言模型(LLM)
2023LLaMA / GPT-4大模型开源生态 / 多模态与工具使用多模态模型
2014VAE生成隐变量+重参数化学习数据分布VAE 与 GAN
2014GAN生成生成器判别器对抗博弈VAE 与 GAN
2019StyleGAN生成可控高质量人脸生成VAE 与 GAN
2020DDPM生成加噪-去噪的扩散生成范式扩散模型与生成式 AI
2022Stable Diffusion生成潜空间扩散+文本条件,文生图平民化扩散模型与生成式 AI
2024Sora生成扩散扩展到长时视频扩散模型与生成式 AI
2015Adam效率动量+自适应学习率默认优化器优化与梯度下降
2015知识蒸馏效率小模型学大模型软标签优化与梯度下降
2017Sparsely-Gated MoE效率稀疏专家路由,激活部分参数大语言模型(LLM)
2022FlashAttention效率IO 感知的注意力加速大语言模型(LLM)
2022-23GPTQ / AWQ / 投机采样效率量化与投机解码降低推理成本MLOps 与模型部署
2016AlphaGo科学应用深度 RL 击败人类棋手深度强化学习应用
2021AlphaFold2科学应用蛋白质结构预测达实验级深度强化学习应用
2024AlphaFold3 / AlphaGeometry科学应用复合物结构 / 奥数级定理证明深度强化学习应用

十、权衡与取舍 ​

  • 地图≠知识:看地图能快速定位,但"一句话贡献"会掩盖大量细节与失败——比如 ResNet 的成功建立在 VGG 的深度教训之上,脱离上下文的一句话会失真。
  • 主线 vs 支线:这张地图突出了七条主流线,但强化学习(AlphaGo 之外还有推荐、控制)、图神经网络、语音等支线同样重要,可去对应栏目深挖。
  • 历史视角的局限:所有地图都带着"事后诸葛亮"的滤镜。读的时候要记得:当年没人知道哪篇会封神,很多当时被忽视的论文(如 Transformer 早期、RNN 早期的批判)后来被反复重新发现。
  • 别背地图:地图的价值是"定位"而非"记忆"。遇到陌生模型时,问一句"它在哪条主线上、继承了什么、挑战了什么",就够用了。

延伸阅读 ​

参考资料 ​