外观
数学基础速查
一句话定义:一张按「DL 需要什么数学」组织的速查表——线性代数、微积分、概率统计、优化四章,每个公式都配一句「为什么深度学习中需要它」,用于面试追问、读论文与调参时的即时查漏。
它不是系统教材,是「查漏地图」:遇到不熟的公式,先看本页的 DL 语境解释,再回术语表确认术语,最后在概念页面看应用。
一、线性代数
向量与矩阵基础
- 向量:一组有序数 $\mathbf{x} \in \mathbb{R}^n$。在 DL 中,特征、嵌入、单层输出都是向量。
- 矩阵:$\mathbf{W} \in \mathbb{R}^{m \times n}$,线性变换。神经网络每一层都是「矩阵乘法 + 偏置 + 非线性」。
- 矩阵乘法:$(AB){ij} = \sum_k AB_{kj}$。前向传播 $h = Wx$ 就是 $h_i = \sum_j W_{ij}x_j$——批处理就是一次算很多样本的矩阵乘法。
- 转置/逆/单位阵:$W^T$、$W^{-1}$(要求可逆)、$I$。梯度回传时经常出现转置(链式法则中转置就是把梯度「沿反方向传回去」)。
- 矩阵乘法结合律但交换律不成立:$ABC$ 先算哪两个顺序可以选——链式法则里如何安排乘法顺序决定计算量(比如 $(A B) x$ vs $A (B x)$)。
范数与内积
- 内积:$\langle \mathbf{x}, \mathbf{y}\rangle = \sum_i x_i y_i = \mathbf{x}^T\mathbf{y}$,度量「两个向量多对齐」。注意力分数本质就是内积:$q^Tk$。
- L2 范数:$|\mathbf{x}|_2 = \sqrt{\sum_i x_i^2}$,欧氏长度。权重衰减(L2 正则化)就是在损失上加 $\lambda|\mathbf{W}|_2^2$,见过拟合与正则化。
- L1 范数:$|\mathbf{x}|_1 = \sum_i |x_i|$,诱导稀疏解。Lasso 正则化用 L1。
- Frobenius 范数:$|\mathbf{W}|F = \sqrt{\sum W_{ij}^2}$,矩阵的「L2 长度」。
特征值与矩阵分解
- 特征值与特征向量:$Av = \lambda v$。矩阵乘法的「作用方向」由特征向量描述,谱半径(最大特征值绝对值)决定线性迭代是否稳定——这是理解梯度爆炸/消失的数学钥匙,见初始化与归一化。
- 特征值分解:$A = Q\Lambda Q^{-1}$(对称矩阵可正交对角化)。
- 奇异值分解(SVD):$A = U\Sigma V^T$,任意矩阵都可分解。用途:主成分分析(PCA)、降维、矩阵低秩近似、LoRA 背后的「低秩假设」(权重增量近似低秩)。
- 正定矩阵:$\mathbf{x}^TA\mathbf{x} > 0$(对非零 x)。凸二次型的碗状地形由正定矩阵刻画。
二、微积分
导数与偏导
- 导数:$f'(x) = \lim_{h\to 0}\frac{f(x+h)-f(x)}{h}$,函数在一点的局部变化率。
- 偏导数:多变量函数对某个变量的导数,其余变量视为常数。梯度就是全部偏导组成的向量:$\nabla f = (\partial f/\partial x_1, \ldots, \partial f/\partial x_n)$。
- 常见导数:$(x^n)' = nx^{n-1}$、$(\log x)' = 1/x$、$(e^x)' = e^x$、$(\sigma(x))' = \sigma(x)(1-\sigma(x))$(sigmoid 导数写成自身的函数,工程上很好用)。
- Softmax 的导数:$\partial \text{softmax}i / \partial z_j = p_i(\delta - p_j)$——这正是「预测减真值」梯度公式的由来,见损失函数与输出层。
链式法则与自动微分
- 链式法则:$\frac{dy}{dx} = \frac{dy}{du}\cdot\frac{du}{dx}$。反向传播就是链式法则的工程化:复合函数 $L = f(g(h(x)))$ 的梯度 = 各层导数的乘积,见反向传播与自动微分。
- 雅可比矩阵:$J_{ij} = \partial y_i / \partial x_j$,向量函数的全导数。每个层的前向/反向变换都可以写成雅可比,残差连接让雅可比中多出单位阵,从而缓解梯度消失。
- 泰勒展开:$f(x) \approx f(x_0) + f'(x_0)(x-x_0)$——梯度下降就是反复用一阶泰勒逼近;二阶项(Hessian)对应牛顿法。损失函数可视化与「损失地形」概念由此而来。
梯度与优化中的微积分
- 梯度方向是函数上升最快的方向,所以参数沿负梯度更新:$\theta \leftarrow \theta - \eta\nabla_\theta L$,见优化与梯度下降。
- 学习率 $\eta$ 就是泰勒展开的步长:太大一步跨出可信区间(震荡/发散),太小收敛慢。
三、概率与统计
随机变量与分布
- 随机变量/概率分布:$X \sim p(x)$,$p$ 描述取值可能性。模型输出 $p(y|x)$ 是对真实条件分布的逼近。
- 期望与方差:$E[X] = \sum_x x p(x)$;$\text{Var}(X) = E[(X-E[X])^2]$。优化目标本质是最小化期望损失;方差对应「泛化差距」的随机性来源。
- 常用分布:伯努利(二分类)、类别分布(多分类)、高斯分布 $N(\mu,\sigma^2)$(回归误差、初始化、扩散模型的加噪)。
- 独立同分布(i.i.d.):训练集样本假设独立同分布——这个假设被破坏就是数据漂移,见评估实践。
条件概率与贝叶斯
- 条件概率:$P(A|B) = \frac{P(A\cap B)}{P(B)}$。分类器输出 $P(y|x)$ 就是条件概率。
- 贝叶斯定理:$P(y|x) = \frac{P(x|y)P(y)}{P(x)}$。把「先验 $P(y)$ + 似然 $P(x|y)$」更新为「后验 $P(y|x)$」。VAE 的整个推导建立在「最大化数据似然 + 变分后验逼近」上,见VAE 与 GAN。
- 极大似然估计(MLE):$\hat\theta = \arg\max_\theta \prod_i p_\theta(x_i)$,等价于最小化负对数似然。交叉熵损失就是负对数似然——所以分类用交叉熵,本质是「最大化正确类概率」。
信息论
- 熵:$H(p) = -\sum_x p(x)\log p(x)$,分布的不确定性度量。
- 交叉熵:$H(p,q) = -\sum_x p(x)\log q(x) = H(p) + D_{KL}(p|q)$。分类损失 = 真值分布与预测分布的交叉熵。
- KL 散度:$D_{KL}(p|q) = \sum_x p(x)\log\frac{p(x)}{q(x)}$,衡量分布差异,非对称($D_{KL}(p|q) \neq D_{KL}(q|p)$),恒 ≥ 0。KL 散度在 VAE(变分下界)、GAN、蒸馏、RLHF 中无处不在。
交叉熵为什么配 softmax?
softmax 把 logits 归一化成概率分布 $q$;交叉熵损失对 logits 求导得到简洁的 $(p - q)$(真值减预测),梯度又大又稳定。而 MSE + softmax 在饱和区梯度趋零、训练极慢。详见损失函数与输出层页。
四、优化
- 凸集与凸函数:$f(\lambda x + (1-\lambda)y) \le \lambda f(x) + (1-\lambda)f(y)$。凸函数无局部极小困扰(局部=全局)。神经网络损失非凸,所以才有初始化、学习率调度、动量这些「非凸时代的工程武器」,见优化与梯度下降页。
- 梯度下降:$\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)$。三种变体:全量(GD)、mini-batch(实践标准)、随机(SGD)。
- 动量:$\theta_{t+1} = \theta_t - \eta v_t$,$v_t = \beta v_{t-1} + (1-\beta)\nabla L$——对梯度做指数滑动平均,抑制震荡、加速平坦方向。
- Adam:自适应调整每个参数的学习率(梯度一阶矩/二阶矩),对超参鲁棒。AdamW 修正权重衰减实现方式,大模型微调标配。
- 鞍点 vs 局部极小:高维损失空间中鞍点(某些方向向下、某些向上)比局部极小常见得多——这也是随机性与动量有效的原因之一。
- 学习率调度:warmup、cosine、step decay。Transformer 预训练几乎必配 warmup:初期参数随机、梯度噪声大,先小步走稳。
五、速查表:DL 公式速记
| 概念 | 公式 | DL 场景 |
|---|---|---|
| 线性层 | $h = Wx + b$ | 每一层的核心计算 |
| 注意力 | $\text{softmax}(QK^T/\sqrt{d_k})V$ | Transformer 核心,见Transformer 架构 |
| 交叉熵损失 | $L = -\sum_i y_i \log \hat{y}_i$ | 分类任务标配损失 |
| 交叉熵梯度 | $\partial L/\partial z = \hat{y} - y$ | 为什么训练稳定 |
| L2 正则 | $L = L_0 + \lambda|\theta|_2^2$ | 权重衰减 |
| 梯度更新 | $\theta \leftarrow \theta - \eta\nabla L$ | 一切优化的起点 |
| 贝叶斯 | $P(y | x) \propto P(x |
| KL 散度 | $\sum p\log(p/q)$ | 生成模型与对齐 |
延伸阅读
- 神经网络基础——数学公式的第一个应用场景
- 反向传播与自动微分——链式法则怎么变成算法
- 优化与梯度下降——凸性、梯度下降与动量
- 损失函数与输出层——交叉熵与 softmax 的组合
- 术语表——术语与公式互查
- 面试题库——数学类面试题怎么考