深度学习演进简史
从 1958 年感知机到 2026 年的大模型时代,完整梳理深度学习三次热潮与两次寒冬的起落,讲清每次跃迁背后算力、数据、算法三要素的合力,以及历史给今天的方法论启示。
DEEP LEARNING HANDBOOK
从数据到智能的系统化知识 —— 神经网络 · 反向传播 · 注意力机制 · 生成式模型 · 大模型 · MLOps · 职业路径
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
从每个栏目里精选,值得先读的这些
用一句话、一段可运行的 NumPy 代码和三个实证刻度回答"什么是深度学习":多层神经网络如何从数据自动学习特征,它与经典机器学习的区别,为什么有效,以及它的代价与边界。
导读反向传播是深度学习训练的地基:链式法则 + 梯度回传。本文从"为什么需要梯度"讲起,手推一个小网络逐步求导,再过渡到自动微分的两种模式,最后给出 PyTorch autograd 的正确用法、常见误区与梯度消失/爆炸的根源。
核心知识深度学习模型的宿敌不是"能力不足"而是"背得太多"。本文用偏差-方差分解讲清过拟合机制,系统梳理 L1/L2、Dropout、早停、数据增强、标签平滑、EMA、Mixup 等正则化武器,并给出组合与强度选择的工程经验。
核心知识神经网络是一切深度学习的地基。本文从单个神经元讲起,用对比表厘清六种常用激活函数,给出 MLP 前向传播的 PyTorch 实现,并用万能近似定理解释"为什么深比宽高效",最后讨论容量、深度与数据之间的权衡。
核心知识梯度下降是让神经网络"学会"的引擎。本文从学习率直觉讲起,梳理 SGD、动量、Adam/AdamW 的演进逻辑,覆盖学习率调度、梯度裁剪与 batch size 缩放规律,最后给出可直接照抄的工程默认配方表。
核心知识注意力是 Transformer 与一切现代大模型的心脏。本文讲清"软检索"思想与 QKV 缩放点积注意力、多头动机、三类位置编码、自/交叉注意力与因果掩码,并覆盖 O(n²) 复杂度、FlashAttention 与 KV cache 等工程要点。
核心知识大语言模型是 Transformer 规模化的集大成者。本文覆盖预训练与数据配比、扩展定律、SFT 指令微调、RLHF/DPO 对齐、上下文学习与 RAG、KV cache 等推理优化,并直面幻觉与评估批判,最后讨论从 LLM 到 Agent 的跃迁。
经典案例扩散模型以"逐步加噪再逐步去噪"绕过了 VAE 的模糊与 GAN 的不稳定,成为文生图、视频、音频等生成式 AI 的主流引擎。本文拆解 DDPM 原理、DDIM 加速采样、Classifier-Free Guidance 引导、Stable Diffusion 三件套与 LoRA/ControlNet,并讨论评估与局限。
经典案例卷积神经网络是深度学习的第一个引爆点。本文拆解卷积/池化/残差三大构件与从 LeNet 到 ViT 的架构演进,覆盖图像任务家族、迁移学习黄金配方(附 PyTorch 代码)与训练技巧,并梳理 CLIP/SAM/VLM 等视觉大模型现状。
经典案例Transformer 用自注意力取代循环结构,成为大模型时代的事实标准。本文拆解 Encoder/Decoder 整体架构、多头自注意力、位置编码、Pre-Norm/Post-Norm,给出 warmup 等训练技巧,梳理 BERT vs GPT 家族与 ViT/跨模态扩展,并介绍 FlashAttention、KV cache 等工程优化。
经典案例深度学习学习者为什么要读论文?懂原理不背 API、跟上前沿、面试加分。本文给出三条阅读路线(两小时快速入门/工程落地/做研究)与本栏目五页地图,并奉上最重要的建议——带走机制,别带走数字。
论文精读逐篇精读十几篇改变领域的经典论文:感知机、反向传播、LeNet、AlexNet、ResNet、LSTM、Transformer、BERT、GPT-3、Adam、BatchNorm、GAN、DDPM。每篇按背景与问题、核心方法、关键实验、局限与后续影响四段式拆解,附精读时长与配套站内页面。
论文精读用 MNIST 手写数字识别走通深度学习完整流程:环境搭建、数据加载与预处理、从 MLP 到 CNN 的模型演进、显式训练循环、评估与错误分析、项目仓库结构,以及新手最容易踩的坑。适合作为你的第一个端到端项目。
实践指南模型不工作时的系统化排查方法:先用小样本过拟合验证管道,再按 loss 不降排查表、梯度检查、NaN 溯源、分布可视化、单元测试、消融实验逐层定位问题。附一张高频 bug 清单,让你的调试从"瞎试"变成"按图索骥"。
实践指南深度学习训练是一场按配方操作又需要临场判断的烹饪。本文给出数据、初始化、损失、优化器、学习率、正则化、归一化的默认配方表,讲透学习率范围测试、batch size 联动、warmup 与余弦退火、迁移学习与显存管理,最后是复现实验的纪律。
实践指南深度学习岗位面试分类题库:基础概念、架构、训练、数学、工程、大模型、开放题七个维度共 30+ 题,每题给出答题要点与关联页面,用于按 JD 补课的定向自测。
求职与JD深度学习所需的数学速查手册:线性代数(向量/矩阵/范数/特征值/SVD)、微积分(导数/偏导/链式法则/雅可比/泰勒展开)、概率统计(分布/期望/贝叶斯/极大似然/熵与 KL 散度)、优化(凸性与梯度下降),每个公式给出深度学习语境解释。
资源按模块浏览,或直接搜索
从 1958 年感知机到 2026 年的大模型时代,完整梳理深度学习三次热潮与两次寒冬的起落,讲清每次跃迁背后算力、数据、算法三要素的合力,以及历史给今天的方法论启示。
把"一个深度学习问题"解剖成六个环节——问题定义、数据、模型、损失、优化训练、评估部署,并给出训练循环图解和一张"我该去哪个栏目"的全站导航表。
用一句话、一段可运行的 NumPy 代码和三个实证刻度回答"什么是深度学习":多层神经网络如何从数据自动学习特征,它与经典机器学习的区别,为什么有效,以及它的代价与边界。
本站 54 页内容如何高效使用?本文给出三条路线:约 2 周的求职冲刺、约 8 周的系统精进,以及一张"问题→页面"的案头速查索引,每条路线都配有周节奏与验收标准。
厘清人工智能、机器学习、深度学习与经典算法的概念边界和真实分工,并用"数据形态"这把尺子给出可操作的选型判断:什么场景该上深度模型,什么场景该用 GBDT。
深度学习的秘密武器不是拟合能力,而是"学出好表征"。本文讲清特征层级与端到端思想、embedding 空间的语义结构,梳理迁移学习与微调策略、预训练-微调范式,并深入自监督学习(SimCLR/MAE)与表征评估方法。
权重初始化与归一化层是深度网络"训得动"的隐形前提。本文讲清为什么初始化重要、Xavier/He 的推导直觉,对比 BatchNorm/LayerNorm/GroupNorm/InstanceNorm 的适用场景,并解释两者如何互补地驯服梯度。
反向传播是深度学习训练的地基:链式法则 + 梯度回传。本文从"为什么需要梯度"讲起,手推一个小网络逐步求导,再过渡到自动微分的两种模式,最后给出 PyTorch autograd 的正确用法、常见误区与梯度消失/爆炸的根源。
深度学习模型的宿敌不是"能力不足"而是"背得太多"。本文用偏差-方差分解讲清过拟合机制,系统梳理 L1/L2、Dropout、早停、数据增强、标签平滑、EMA、Mixup 等正则化武器,并给出组合与强度选择的工程经验。
模型越强,越需要回答"它为什么这么判、对谁公平"。本文梳理事后解释(Saliency/Grad-CAM/LIME/SHAP)、机制可解释性(探针/电路)、解释的局限与幻觉,并展开公平性偏差、评估与对齐安全的讨论。
强化学习让智能体在试错中最大化累积奖励,深度 RL 则把神经网络变成它的"大脑"。本文讲清 MDP 设定、DQN 家族与 Actor-Critic 谱系、PPO/SAC 的定位,并延伸到探索-利用权衡、奖励设计以及 RLHF 对 LLM 的意义。
没有可靠的评估,深度学习项目就无法前进。本文覆盖三集划分与数据泄漏防线、学习曲线诊断、分类/回归/生成三类指标、超参数搜索与实验管理、baseline 纪律,并剖析评估中最常见的陷阱。
神经网络是一切深度学习的地基。本文从单个神经元讲起,用对比表厘清六种常用激活函数,给出 MLP 前向传播的 PyTorch 实现,并用万能近似定理解释"为什么深比宽高效",最后讨论容量、深度与数据之间的权衡。
判别模型回答"这是什么",生成模型回答"造一个出来"。本文梳理显式/隐式密度模型谱系,逐个讲清 VAE(ELBO/重参数化)、GAN(对抗博弈/模式坍缩)、扩散模型(DDPM)与自回归生成的原理与关系,并给出选型表。
「模型是水的杯子,数据是水」——数据质量直接决定模型上限。本文覆盖数据管道、三类模态的增强方法、标注与主动学习、数据质量治理(去重/去偏/噪声)、数据泄露防线、分布式加载与数据版本管理。
损失函数是梯度信号的源头,也是"模型在优化什么"的直接定义。本文讲透输出层与损失必须匹配的原理,覆盖分类(交叉熵/BCE/标签平滑/Focal)、回归(MSE/MAE/Huber)、排序与对比损失,并给出多任务平衡与调试要点。
梯度下降是让神经网络"学会"的引擎。本文从学习率直觉讲起,梳理 SGD、动量、Adam/AdamW 的演进逻辑,覆盖学习率调度、梯度裁剪与 batch size 缩放规律,最后给出可直接照抄的工程默认配方表。
注意力是 Transformer 与一切现代大模型的心脏。本文讲清"软检索"思想与 QKV 缩放点积注意力、多头动机、三类位置编码、自/交叉注意力与因果掩码,并覆盖 O(n²) 复杂度、FlashAttention 与 KV cache 等工程要点。
实验室里调通的模型距离可靠产品还差一整条工程链。本文覆盖 DL 生命周期全景、实验跟踪与模型注册、在线/批处理/边缘三种部署、量化/蒸馏/剪枝等推理优化、数据与概念漂移监控,以及 CI/CD、成本与延迟的权衡。
大语言模型是 Transformer 规模化的集大成者。本文覆盖预训练与数据配比、扩展定律、SFT 指令微调、RLHF/DPO 对齐、上下文学习与 RAG、KV cache 等推理优化,并直面幻觉与评估批判,最后讨论从 LLM 到 Agent 的跃迁。
多模态模型让 AI 同时理解文本、图像、音频与视频。本文拆解 CLIP/ALIGN 的对比学习对齐、LLaVA/Qwen-VL/GPT-4V 的"视觉编码器+投影+LLM"架构、模态融合的早期/晚期/跨注意力方案,并介绍 Gemini/Omni 统一模型、MMMU 等评估、多模态 Agent 与 RAG,以及当下局限。
扩散模型以"逐步加噪再逐步去噪"绕过了 VAE 的模糊与 GAN 的不稳定,成为文生图、视频、音频等生成式 AI 的主流引擎。本文拆解 DDPM 原理、DDIM 加速采样、Classifier-Free Guidance 引导、Stable Diffusion 三件套与 LoRA/ControlNet,并讨论评估与局限。
深度强化学习把神经网络与序贯决策结合,从 DQN 打游戏、AlphaGo 战胜人类到 LLM 中的 RLHF/RLVR,一步步走进真实世界。本文拆解 DQN/AlphaGo 原理、机器人 sim-to-real、游戏 AI,并直面样本效率、安全、奖励设计与分布偏移等现实挑战。
推荐系统是深度学习在互联网工业界最赚钱的战场。本文从召回/粗排/精排/重排四层架构讲起,覆盖矩阵分解到神经协同过滤、双塔召回、SASRec 序列推荐、DCN/Wide&Deep CTR 精排、PinSage 图推荐与 MMoE 多目标,并给出冷启动、评估与上线要点的实战视角。
图神经网络把深度学习扩展到节点与边的结构数据上。本文拆解图的表示、消息传递框架与 GCN/GAT/GraphSAGE 三大主流模型,覆盖节点分类/边预测/图分类任务与应用(推荐、分子、物理模拟),并直面邻居采样、过平滑与可扩展性等局限。
语音与音频是深度学习早期落地最深的领域之一。本文从波形/MFCC/梅尔谱等表示讲起,梳理 ASR 从 CTC 到 Seq2Seq 再到 Whisper 大规模弱监督的演进,TTS 从 Tacotron/WaveNet 到 VITS 与扩散 TTS,并介绍语音增强、分离、音频大模型与流式延迟的工程权衡。
卷积神经网络是深度学习的第一个引爆点。本文拆解卷积/池化/残差三大构件与从 LeNet 到 ViT 的架构演进,覆盖图像任务家族、迁移学习黄金配方(附 PyTorch 代码)与训练技巧,并梳理 CLIP/SAM/VLM 等视觉大模型现状。
循环神经网络是为序列数据设计的递归架构,是语言模型、机器翻译与语音识别的地基。本文拆解 RNN 展开图、BPTT 与梯度消失、LSTM 三门结构与 GRU,对比 Transformer 的差异,并盘点流式语音、在线预测等现存场景。
Transformer 用自注意力取代循环结构,成为大模型时代的事实标准。本文拆解 Encoder/Decoder 整体架构、多头自注意力、位置编码、Pre-Norm/Post-Norm,给出 warmup 等训练技巧,梳理 BERT vs GPT 家族与 ViT/跨模态扩展,并介绍 FlashAttention、KV cache 等工程优化。
VAE 与 GAN 是深度生成模型的奠基双雄:VAE 以变分推断学隐空间、GAN 以对抗博弈逼真数据。本文拆解重参数化技巧与 ELBO、minimax 博弈与模式坍缩,梳理 DCGAN/WGAN-GP/StyleGAN 改进谱系与条件生成,并对比扩散模型的现状。
深度学习学习者为什么要读论文?懂原理不背 API、跟上前沿、面试加分。本文给出三条阅读路线(两小时快速入门/工程落地/做研究)与本栏目五页地图,并奉上最重要的建议——带走机制,别带走数字。
逐篇精读十几篇改变领域的经典论文:感知机、反向传播、LeNet、AlexNet、ResNet、LSTM、Transformer、BERT、GPT-3、Adam、BatchNorm、GAN、DDPM。每篇按背景与问题、核心方法、关键实验、局限与后续影响四段式拆解,附精读时长与配套站内页面。
把深度学习六十年关键论文按主题与时间轴排成一张地图:奠基时代、卷积时代、序列建模、注意力与大模型、生成式、效率与优化、科学应用。每篇论文一句话贡献,配综合表格(年份/论文/主题/贡献/关联站内页)。
近年深度学习的重要突破与趋势:大模型扩展定律与合成数据、MoE 稀疏专家、多模态统一、RLHF 与对齐(DPO/RLVR)、扩散应用扩展、推理时计算(o1 类)、Agent 与工具使用、效率革命、科学发现。每项给出是什么、为什么重要、代表工作与关联站内页,并标注时效性数据的阅读方式。
读论文的方法论 FAQ:怎么选第一篇、读不懂怎么办、三问笔记框架、如何判断论文好坏(与基线比较、消融、代码开源)、如何复现、如何用 5 步讲好一篇论文,以及常见误区与阅读纪律。全文以问答形式组织,可直接按需查用。
按目标编排的论文阅读路线:路线 A 两小时快速入门精读 3-5 篇经典,路线 B 工程落地掌握 BatchNorm、Adam 与微调类论文,路线 C 研究进阶啃推导与综述。每篇给出推荐理由、阅读深度与配套站内页面,附阅读节奏建议。
深度学习实践中最常翻车的场景,每个都给你症状、原因、解法:数据泄漏、评估泄漏、学习率错误、忘记归一化、类别不平衡、不固定种子、验证集过拟合、BatchNorm 陷阱、混合精度 bug、微调学习率过大、显存 OOM,以及"看起来对"的假象。
用 MNIST 手写数字识别走通深度学习完整流程:环境搭建、数据加载与预处理、从 MLP 到 CNN 的模型演进、显式训练循环、评估与错误分析、项目仓库结构,以及新手最容易踩的坑。适合作为你的第一个端到端项目。
模型不工作时的系统化排查方法:先用小样本过拟合验证管道,再按 loss 不降排查表、梯度检查、NaN 溯源、分布可视化、单元测试、消融实验逐层定位问题。附一张高频 bug 清单,让你的调试从"瞎试"变成"按图索骥"。
同一个图像分类任务,用三版代码迭代演进:v1 最小可用 MLP 先让管道跑通,v2 加数据增强、BatchNorm、学习率调度与早停,v3 换预训练 CNN 并做完整评估。每一版都讲清"解决什么问题、代价是什么",并给出对比表。
框架选择不是信仰问题,而是匹配问题。本文对比 PyTorch、JAX、TensorFlow/Keras 在生态、易用、性能、调试上的差异,梳理多卡训练、推理加速、HuggingFace 生态的选型,最后给出一棵"根据你的场景怎么选"的决策树。
准确率不是评估的全部。本文讲透评估设计:按业务场景选指标、置信区间与多次运行、A/B 测试与线上评估、失败分析与错误集复盘、评估集构建的防泄漏纪律、生成模型的人工评估,并给出一份图像分类完整评估流程的可运行代码。
深度学习训练是一场按配方操作又需要临场判断的烹饪。本文给出数据、初始化、损失、优化器、学习率、正则化、归一化的默认配方表,讲透学习率范围测试、batch size 联动、warmup 与余弦退火、迁移学习与显存管理,最后是复现实验的纪律。
从"会跑代码"到"能讲清楚的项目":本文给出选项目标准、经过验证的好项目清单(图像分类、文本分类、小 LLM 微调、扩散微调、推荐系统),以及端到端展示方法——README 模板、代码质量、Gradio/HF Spaces 部署、把项目讲成故事、简历呈现技巧。
深度学习工程不是碰运气,而是一套可训练的思维习惯。本文总结八条设计原则:先跑通简单基线、数据优先、模块化与配置化、一次只变一个变量、可复现性、渐进复杂度、失败先怀疑自己代码、可扩展性思维,并给出每一条的具体做法。
深度学习岗位面试分类题库:基础概念、架构、训练、数学、工程、大模型、开放题七个维度共 30+ 题,每题给出答题要点与关联页面,用于按 JD 补课的定向自测。
求职模块的入口页:用「看清市场→看清自己→包装自己→证明自己」四步流水线串起五篇内容;给出深度学习 9 类岗位的职责、核心技能与薪资粗粒度参考;提供三维决策清单帮你选择方向。
深度学习岗位简历怎么写才能过初筛:项目经历「背景-方案-结果-复盘」四段式模板与改写前后对比,技能栏按框架/模型/工程归类的写法,六大常见简历错误,以及不同岗位的简历侧重。
拆解 8 个代表性深度学习岗位 JD(国内大厂 CV/NLP/大模型/算法,海外 MLE/Research Scientist/Applied Scientist),逐条提炼职责要点、硬性要求、加分项与对应本站页面;附 JD 技能词频率统计表与薪资、学历门槛提示。
把 JD 技能词翻译成本站的页面与知识点:一张 20+ 行的「技能词→页面」映射大表,配合「会/不会/半会不会」三分标注法,生成个人补课清单与补课顺序。
深度学习学习资源精选:吴恩达 Deep Learning Specialization、CS231n、CS224n、Karpathy Zero to Hero 等经典课程,花书/D2L 等必读书,distill.pub、Lil'Log 等高质量博客,PyTorch/HuggingFace 等工具生态,以及会议与论文合集。
深度学习核心术语速查词典:基础概念、模型与层、训练与优化、正则化、生成式与 LLM、评估与数据、生产与可信七组 60+ 条术语,含易混淆术语辨析与站内深入链接。
深度学习数据集档案:图像(MNIST/CIFAR/ImageNet/COCO)、文本(GLUE/SQuAD/Wikipedia/The Pile)、语音、多模态与分子图数据集,每项给规模/任务/获取方式/注意点;附 PyTorch、HuggingFace、peft 等工具档案与选数据集原则。
深度学习所需的数学速查手册:线性代数(向量/矩阵/范数/特征值/SVD)、微积分(导数/偏导/链式法则/雅可比/泰勒展开)、概率统计(分布/期望/贝叶斯/极大似然/熵与 KL 散度)、优化(凸性与梯度下降),每个公式给出深度学习语境解释。