外观
深度学习总体架构解剖
一句话:任何一个深度学习项目,无论规模多大,都可以解剖成六个环节——问题定义 → 数据 → 模型架构 → 损失函数 → 优化训练 → 评估部署。本文先逐环节讲清每个环节要回答的核心问题与常见错误,再图解贯穿全程的训练循环,最后用一张全站内容地图告诉你"每个环节该去站点的哪个栏目"。如果还没读过什么是深度学习,建议先读那篇,再回到这里看全景。
问题定义 → 数据 → 模型架构 → 损失函数 → 优化训练 → 评估部署
↑ │
└────────────── 不达标则回溯调整 ─────────────────────┘注意图中最下面那条回环:深度学习项目极少是直线推进的。评估不达标时,问题可能出在任何一个上游环节——数据泄漏、模型欠拟合、损失选错、超参数不合适,都需要回溯排查。这条回环意识,就是工程与"跑通一个 notebook"之间的分水岭。
一、六环节全景
1. 问题定义:预测什么?输入输出各是什么?用什么指标衡量成功(准确率、F1、NDCG,还是业务指标)?核心决策是把"业务问题"翻译成"机器学习问题"并选定评估指标。常见错误是指标定义得含糊——"效果好"如果不落到某个可计算的量上,后面所有环节都无法客观判断。指标怎么设计、实验怎么做,见深度学习评估与实验;从问题反推方案的通用思路见DL 设计原则。
2. 数据:规模、质量、分布、标注一致性与数据泄漏是这里的四个关键词。核心决策包括:数据从哪来、如何清洗与增强、如何切分训练/验证/测试集。常见错误是切分不当造成数据泄漏——把同一用户或同一场景的样本同时放进训练集和测试集,会让评估结果虚高得完全失真。数据全流程见数据与数据工程,公开数据集索引见数据集与工具档案。
3. 模型架构:选择网络结构的本质是选择归纳偏置——你愿意相信哪种先验。图像默认 CNN(局部性、平移等变),文本与序列默认 Transformer(长程依赖、并行),图结构用 GNN,跨模态任务用多模态架构。常见错误是"架构崇拜":从超参数无关的视角纠结于某个新架构,却忘了先跑一个简单基线。各架构展开见CNN 与计算机视觉、Transformer 架构、RNN 与序列建模、图神经网络与多模态模型。
4. 损失函数:把"模型差多少"变成一个可微的标量。分类用交叉熵,回归用 MSE/MAE,排序用 listwise 损失,生成任务常配合对比/RLHF 目标。核心决策是让损失与业务目标对齐——一个经典反例是"用准确率评估、却用平方误差训练"的错位。各类损失的适用场景见损失函数与输出层。
5. 优化训练:把损失降下去。涉及优化器与学习率、初始化、归一化、正则化,以及"训练配方"(batch size、epoch、早停、梯度裁剪等)的整体编排。常见错误是只看模型不看配方——大量"模型效果差"其实是学习率或初始化不合适。相关页面:优化与梯度下降、初始化与归一化、过拟合与正则化、训练配方与调参。
6. 评估部署:离线评估(泛化性能、鲁棒性、偏差)→ 在线实验(A/B)→ 部署上线(服务化、监控、回滚、再训练)。核心决策是建立可信的离线-在线一致性:离线指标再好,上线后掉点才是常态。评估方法论见评估实践,上线链路见MLOps 与模型部署。
六个环节的优先级
新手最常见的错误是在"模型架构"上花掉 90% 的时间,而真实项目的经验恰恰相反:数据质量、评估设计与训练配方,通常比架构本身更能决定结果。先跑通基线,再用数据说话,是DL 设计原则的第一条。
二、训练循环图解
训练阶段是六个环节中"反复运转"的引擎,无论什么模型,循环体都只有四步:
┌──────────────── 一个训练循环(iteration / epoch) ────────────────┐
│ ① 前向传播:batch X ──→ 网络 ──→ 预测 ŷ │
│ ② 损失计算:L = loss(ŷ, y) │
│ ③ 反向传播:∂L/∂θ 逐层回传,得到每个参数的梯度 │
│ ④ 参数更新:θ ← θ − lr · ∂L/∂θ(梯度下降/其变体) │
└───────────────────────────────────────────────────────────────┘四步一一对应深度学习最核心的三个概念页:
- ① 前向传播是神经网络基础的全部内容——数据逐层流动,每层做"线性变换 + 非线性激活";
- ③ 反向传播是把损失对每个参数的偏导数算出来的算法,见反向传播与自动微分;
- ④ 参数更新是优化与梯度下降的主题——学习率、动量、Adam 等优化器都在这一步起作用;
- ② 损失计算见损失函数与输出层。
循环之外的"训练配方"同样重要:每个 epoch 前打乱数据、每个 batch 后做梯度更新、周期性地在验证集上评估并保存 checkpoint、学习率衰减与早停……这些工程细节直接决定训练能否收敛、是否过拟合,完整配方见训练配方与调参;训练不收敛时的系统性排查见调试与诊断。
三、全站内容地图
本站 50 多页内容正是按上面六个环节组织的,七个栏目各有分工:
| 栏目 | 定位 | 典型入口 |
|---|---|---|
| guide | 导读:全貌、定义、历史、路线 | 什么是深度学习 |
| concepts | 概念:14 个核心原理页,是六环节的"原理层" | 神经网络基础 |
| case-studies | 案例:各架构在真实任务中如何工作 | Transformer 架构 |
| papers | 论文:地图、经典精读、前沿 | 从这里开始 |
| practice | 实践:配方、调试、项目、陷阱 | 从零构建一个深度学习项目 |
| career | 职业:JD、简历、面试 | 模块导读与岗位版图 |
| resources | 资源:术语、数学、数据集、工具 | 术语表 |
它们的配合方式是一条"金字塔":
- guide 打底:先建立全貌与概念边界(学习路径:三条路线告诉你按目标怎么走);
- concepts 建原理:六环节里的每一个决策,都能在 concepts 找到"为什么";
- case-studies 看应用:把原理放到真实任务里检验,看架构如何演化;
- papers 追证据:想知道"谁说的、证据是什么",去论文栏目精读与前沿;
- practice 动手:一切知识最终要在训练循环里跑通,项目与配方是主战场;
- career / resources 是双翼:求职时用 career 做能力对标,查漏时用 resources 做速查。
四、我该去哪个栏目?
| 你的状态 | 先去哪个栏目 |
|---|---|
| 第一次来,想先搞懂全貌 | guide |
| 原理没弄明白(梯度、过拟合、注意力) | concepts |
| 想知道某类模型在真实任务上的效果 | case-studies |
| 想读一手论文、追踪前沿 | papers |
| 想动手做项目、调模型、排查问题 | practice |
| 准备面试、投简历 | career |
| 查术语、公式、数据集、工具 | resources |
三个常见误区,帮你少走弯路:
- 误区一:只读 concepts,不动手。概念页会让你"觉得自己懂了",但真正理解发生在写代码、报错、调试之后——渐进式教程:三版跑起来和从零构建一个深度学习项目专门为此设计。
- 误区二:一上来就追论文。没有概念地基时读论文效率极低;先按阅读路径的顺序来,从论文地图挑里程碑论文而不是最新热文。
- 误区三:把栏目当孤岛。六个环节之间靠"回溯循环"连接,知识也一样:做项目卡住时去查调试与诊断,看不懂公式去翻数学基础速查,这种"按需跳转"才是本站设计的使用方式。
延伸阅读
- 学习路径:三条路线——把解剖图变成可执行的学习计划
- DL vs ML vs AI vs 传统方法——先确认你处理的问题属于哪一类
- 深度学习演进简史——解剖图里的每个环节,都是历史迭代的产物
- 渐进式教程:三版跑起来——由浅入深地跑通第一个项目
- 论文地图——用论文验证你理解的每个环节
- 精选资源清单——收藏常用工具与外部资料
参考资料
本页是站点导航页,无独立学术引用。补充两个支撑"六环节"框架的公开经典: