外观
深度学习演进简史
一句话:深度学习不是 2012 年凭空出现的,而是经历了两度寒冬、三度热潮的七十多年长跑——每次热潮都源于"算法 × 数据 × 算力"三要素的凑齐,每次寒冬则是因为某个要素掉队或承诺跑赢了现实。把今天的一切(Transformer、大模型、多模态)放回这条时间线里理解,你会看得比追逐热点的人更清楚。概念层面的起点见什么是深度学习。
一、完整时间线
| 年代 | 事件 | 意义 |
|---|---|---|
| 1958 | 感知机(Rosenblatt) | 首个可学习的神经网络模型,第一次热潮起点 |
| 1969 | Minsky & Papert《Perceptrons》 | 证明单层感知机无法解决 XOR,研究资助锐减 |
| 1974 | Werbos 博士论文提出反向传播 | 关键算法诞生,却在十余年后才被世界知晓 |
| 1986 | Rumelhart, Hinton, Williams 在《Nature》发表反向传播 | 联结主义复兴,第二次热潮起点 |
| 1989–1998 | LeCun 手写邮编识别、LeNet-5 用于 MNIST | 现代 CNN 的起点,见CNN 与计算机视觉 |
| 1997 | LSTM(Hochreiter & Schmidhuber) | 为序列建模提供长程记忆机制 |
| 1990s–2000s | SVM、核方法、Boosting 占据主流 | 深层网络难训练,第二次寒冬 |
| 2006 | Hinton & Salakhutdinov 深度信念网络(Science) | 用逐层无监督预训练重启深度研究,见表征学习与预训练 |
| 2012 | AlexNet 赢得 ILSVRC-2012 | top-5 错误率压到 15.3%,深度学习时代开启 |
| 2014 | VGG、GoogLeNet、GAN、Adam | 深度工程化、生成对抗网络、自适应优化 |
| 2015 | ResNet、Batch Normalization | 残差连接让 152 层网络可训练,归一化成为标配 |
| 2017 | Transformer(《Attention Is All You Need》) | 注意力取代循环,架构革命,见注意力机制与Transformer 架构 |
| 2018 | ELMo、GPT-1、BERT | "预训练 → 微调"范式定型 |
| 2020 | GPT-3(1750 亿参数)、Scaling Laws、ViT、DDPM | 规模法则确立,扩散模型登场 |
| 2021–2022 | AlphaFold 2、DALL·E 2、Stable Diffusion、ChatGPT | 科学突破 + 生成式 AI 爆发 + 大模型走向大众 |
| 2022–2026 | GPT-4、开源模型(LLaMA、Mistral、Qwen、DeepSeek)、多模态与智能体 | 大模型与多模态时代,见大语言模型(LLM)与多模态模型 |
几条贯穿时间线的观察。第一,标志性论文往往"迟到"但从不缺席:反向传播在 1974 年就由 Werbos 提出,直到 1986 年 Rumelhart 等人把它发表在 Nature 并推广到联结主义框架,才真正改变世界——算法必须等到"能跑起来的算力"和"喂得饱的数据"出现,才算成熟。第二,基准与竞赛是进步的加速器:ILSVRC(ImageNet 竞赛)从 2010 年开始把视觉问题变成"公开数据 + 量化排名",AlexNet 的 15.3% 才成为可复现的里程碑。第三,架构革命往往来自对"主流结构"的釜底抽薪:从循环网络到 Transformer 的切换,不是局部修补,而是整个建模范式的替换。
二、三次热潮与两次寒冬的成因
用"算法、数据、算力"三要素的框架,可以把六十年起伏压缩成一段可记忆的叙事:
第一次热潮(1958–1969):感知机展示了"机器能学习",媒体渲染出"会思考的机器"的狂热。寒冬的成因:Minsky 与 Papert 在《Perceptrons》(1969)中证明单层感知机连 XOR 这种基本问题都解决不了;加上当时根本没有并行计算硬件、没有大数据,承诺严重透支,资助迅速枯竭。启示:线性模型的天花板是数学现实,宣传救不了它。
第二次热潮(1986–1995):反向传播加上并行分布式处理(PDP)框架,让多层网络重新可用,产业界做出了手写识别、支票 OCR 等真实系统。寒冬的成因:深层网络在训练中遭遇梯度消失、难以收敛;数据规模与算力远不足以支撑"深度";与此同时 SVM、Boosting 等核方法在同等数据下更实用,产业期望再次落空。启示:深度本身在当时是"负资产",因为缺少支撑它的配套要素。
第三次热潮(2006 至今):2006 年深度信念网络用逐层预训练解决了"深度难训"的问题,2012 年 AlexNet 则把三个要素一次性凑齐——GPU 算力、ImageNet 大数据、ReLU 与 Dropout 等算法创新。此后 2017 年 Transformer 接棒,2018 年起规模法则把"加大投入"变成可预测的科学,一直延续到今天。启示:这一次热潮与前两次的本质区别,在于"缩放"真的可以被预算——训练损失随算力按幂律下降。
关于"深度"本身的算法救赎也值得单列:激活函数从 sigmoid 换成 ReLU、初始化与归一化方法的进步、残差连接、以及后来的注意力机制,四次迭代分别解决了梯度消失的不同侧面,相关内容见初始化与归一化、过拟合与正则化与反向传播与自动微分。
三、关键人物与机构
- Frank Rosenblatt:感知机提出者,第一次热潮的旗手。
- Marvin Minsky & Seymour Papert:《Perceptrons》作者,用数学证明了单层网络的局限,也客观上催化了后来者对"多层 + 非线性"的探索。
- Geoffrey Hinton:反向传播推广者、深度信念网络提出者、AlexNet 的导师——被称为"深度学习教父"。
- Yann LeCun:CNN 与 LeNet 的奠基人,长期倡导自监督学习。
- Yoshua Bengio:表征学习与序列建模领域的核心推动者。
- 2018 年图灵奖共同授予 Hinton、LeCun、Bengio,官方承认了这条道路的里程碑意义。
- Alex Krizhevsky & Ilya Sutskever:AlexNet 的两位核心作者;Sutskever 后来成为 OpenAI 联合创始人兼首任首席科学家。
- Kaiming He:ResNet 作者,残差连接让"越深越好"第一次变得工程可行。
- Fei-Fei Li:ImageNet 数据集的提出者(2009 年论文,2010 年启动 ILSVRC),"数据驱动视觉"的推动者。
- 机构:Google Brain(现已并入 Google DeepMind)、DeepMind、Meta FAIR、OpenAI、Microsoft、Anthropic、Mistral,以及国内的大模型机构群(如智谱、上海 AI Lab、DeepSeek 等)共同构成了今天的产业生态。
记住人物不是为背书,而是为了理解一个规律:每次跃迁都是由"个人洞见 + 机构资源 + 时代要素"三方汇合的。Hinton 的洞见在 1986 年没有算力支撑,到 2012 年才借 AlexNet 开花;Sutskever 从 AlexNet 到 OpenAI 的路径,则展示了个人如何在机构的放大下改变产业。
四、每次跃迁的方法论启示
- 科学冷遇是常态,被否定的范式会以新形态回归。感知机被《Perceptrons》判了"死刑",它的神经科学直觉(可塑性、联结)却在三十年后由深层网络继承了。别轻易给一条研究路线盖棺定论。
- 简单机制 + 规模化,胜过精巧复杂的理论承诺。Transformer 的核心只有"注意力 + 残差 + LayerNorm",它赢过了一堆花哨的循环变体。深度学习的多数胜利来自"简单 + 大",而不是"复杂 + 妙"。
- 关键洞见会迟到,技术成熟需要配套要素。反向传播 1974→1986→2012 的"迟到史"说明:读论文时要同时问"它的配套要素(数据、算力、工具链)现在成熟了吗"。
- 基准与公开数据是文明的阶梯。ImageNet 模式(好任务 + 公开数据 + 量化排名)今天被复刻到 GLUE、HELM、Open LLM Leaderboard 等无数榜单上。要读懂模型进步,先读懂评测,见深度学习评估与实验与论文地图。
- 范式转换时,旧知识不白费。RNN 时期积累的序列建模直觉(长程依赖、门控)依然服务于今天的架构理解;读经典论文精读时会反复印证这一点。
- 警惕炒作周期。每次寒冬都伴随过度承诺——"感知机将取代人"(1958)与今天的"AGI 将取代一切"(2023–2026)在结构上惊人相似。区分"已证实的缩放规律"与"未证实的叙事"是读者基本功,参见阅读纪律与 FAQ。
五、鉴往知来:历史的边界
历史不会简单重复,但对"边界"保持清醒,是历史给我们最好的礼物。
这次确实不同。 第三次热潮的要素基础与前两次有本质差异:算力成本沿摩尔曲线持续下降;互联网提供了近乎无限的自监督语料;规模法则让"投入产出比"可以量化预算。因此,断言"马上会再来一次寒冬"和断言"这次永远不会有寒冬"同样轻率。
边界依然存在。 算力与能源消耗的增长曲线不可持续(大模型训练能耗以百兆瓦时计);高质量语料面临"数据枯竭"争议;可解释性与监管压力在医疗、金融等领域日益刚性;规模法则在什么规模上失效、是否由数据质量而非纯数量驱动,都还是开放问题。这些不是"唱衰",而是负责任的工程师应当纳入考量的约束条件,相关的工程与管理视角见MLOps 与模型部署。
对个人的启示:与其追逐每个热点名词,不如把三要素(算法直觉、数据意识、算力工具)与基础概念学扎实。七十年历史反复证明,能穿越周期的从来不是某个具体模型,而是对"学习"这件事本身的理解——这正是本站学习路径:三条路线想帮你建立的东西。
延伸阅读
- 什么是深度学习——概念的起点与三个实证刻度
- 深度学习总体架构解剖——历史讲到今天,今天的系统由哪些环节构成
- 学习路径:三条路线——理解了历史,用三条路线把知识变成能力
- 神经网络基础——感知机到现代网络的结构进化史
- 论文地图——把时间线里的里程碑论文按主题归档
- 前沿进展——从 2020 年之后的历史"正在发生"
- 术语表——历史叙事中出现的术语统一索引
参考资料
- Rosenblatt. The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain(Psychological Review 1958)
- Minsky, Papert. Perceptrons: An Introduction to Computational Geometry(MIT Press 1969)
- Rumelhart, Hinton, Williams. Learning representations by back-propagating errors(Nature 1986)
- LeCun, Bottou, Bengio, Haffner. Gradient-based learning applied to document recognition(IEEE 1998)
- Hinton, Salakhutdinov. Reducing the dimensionality of data with neural networks(Science 2006)
- Krizhevsky, Sutskever, Hinton. ImageNet Classification with Deep Convolutional Neural Networks(NeurIPS 2012)
- He et al. Deep Residual Learning for Image Recognition(CVPR 2016)
- Vaswani et al. Attention Is All You Need(NeurIPS 2017)
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding(NAACL 2019)
- Brown et al. Language Models are Few-Shot Learners(NeurIPS 2020)
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models(NeurIPS 2020)