Skip to content

数学基础速查

本页速览 深度学习所需的数学速查手册:线性代数(向量/矩阵/范数/特征值/SVD)、微积分(导数/偏导/链式法则/雅可比/泰勒展开)、概率统计(分布/期望/贝叶斯/极大似然/熵与 KL 散度)、优化(凸性与梯度下降),每个公式给出深度学习语境解释。

数学基础速查

一句话定义:一张按「DL 需要什么数学」组织的速查表——线性代数、微积分、概率统计、优化四章,每个公式都配一句「为什么深度学习中需要它」,用于面试追问、读论文与调参时的即时查漏。

它不是系统教材,是「查漏地图」:遇到不熟的公式,先看本页的 DL 语境解释,再回术语表确认术语,最后在概念页面看应用。

一、线性代数

向量与矩阵基础

  • 向量:一组有序数 $\mathbf{x} \in \mathbb{R}^n$。在 DL 中,特征、嵌入、单层输出都是向量。
  • 矩阵:$\mathbf{W} \in \mathbb{R}^{m \times n}$,线性变换。神经网络每一层都是「矩阵乘法 + 偏置 + 非线性」。
  • 矩阵乘法:$(AB){ij} = \sum_k AB_{kj}$。前向传播 $h = Wx$ 就是 $h_i = \sum_j W_{ij}x_j$——批处理就是一次算很多样本的矩阵乘法
  • 转置/逆/单位阵:$W^T$、$W^{-1}$(要求可逆)、$I$。梯度回传时经常出现转置(链式法则中转置就是把梯度「沿反方向传回去」)。
  • 矩阵乘法结合律但交换律不成立:$ABC$ 先算哪两个顺序可以选——链式法则里如何安排乘法顺序决定计算量(比如 $(A B) x$ vs $A (B x)$)。

范数与内积

  • 内积:$\langle \mathbf{x}, \mathbf{y}\rangle = \sum_i x_i y_i = \mathbf{x}^T\mathbf{y}$,度量「两个向量多对齐」。注意力分数本质就是内积:$q^Tk$。
  • L2 范数:$|\mathbf{x}|_2 = \sqrt{\sum_i x_i^2}$,欧氏长度。权重衰减(L2 正则化)就是在损失上加 $\lambda|\mathbf{W}|_2^2$,见过拟合与正则化
  • L1 范数:$|\mathbf{x}|_1 = \sum_i |x_i|$,诱导稀疏解。Lasso 正则化用 L1
  • Frobenius 范数:$|\mathbf{W}|F = \sqrt{\sum W_{ij}^2}$,矩阵的「L2 长度」。

特征值与矩阵分解

  • 特征值与特征向量:$Av = \lambda v$。矩阵乘法的「作用方向」由特征向量描述,谱半径(最大特征值绝对值)决定线性迭代是否稳定——这是理解梯度爆炸/消失的数学钥匙,见初始化与归一化
  • 特征值分解:$A = Q\Lambda Q^{-1}$(对称矩阵可正交对角化)。
  • 奇异值分解(SVD):$A = U\Sigma V^T$,任意矩阵都可分解。用途:主成分分析(PCA)、降维、矩阵低秩近似、LoRA 背后的「低秩假设」(权重增量近似低秩)。
  • 正定矩阵:$\mathbf{x}^TA\mathbf{x} > 0$(对非零 x)。凸二次型的碗状地形由正定矩阵刻画。

二、微积分

导数与偏导

  • 导数:$f'(x) = \lim_{h\to 0}\frac{f(x+h)-f(x)}{h}$,函数在一点的局部变化率。
  • 偏导数:多变量函数对某个变量的导数,其余变量视为常数。梯度就是全部偏导组成的向量:$\nabla f = (\partial f/\partial x_1, \ldots, \partial f/\partial x_n)$。
  • 常见导数:$(x^n)' = nx^{n-1}$、$(\log x)' = 1/x$、$(e^x)' = e^x$、$(\sigma(x))' = \sigma(x)(1-\sigma(x))$(sigmoid 导数写成自身的函数,工程上很好用)。
  • Softmax 的导数:$\partial \text{softmax}i / \partial z_j = p_i(\delta - p_j)$——这正是「预测减真值」梯度公式的由来,见损失函数与输出层

链式法则与自动微分

  • 链式法则:$\frac{dy}{dx} = \frac{dy}{du}\cdot\frac{du}{dx}$。反向传播就是链式法则的工程化:复合函数 $L = f(g(h(x)))$ 的梯度 = 各层导数的乘积,见反向传播与自动微分
  • 雅可比矩阵:$J_{ij} = \partial y_i / \partial x_j$,向量函数的全导数。每个层的前向/反向变换都可以写成雅可比,残差连接让雅可比中多出单位阵,从而缓解梯度消失。
  • 泰勒展开:$f(x) \approx f(x_0) + f'(x_0)(x-x_0)$——梯度下降就是反复用一阶泰勒逼近;二阶项(Hessian)对应牛顿法。损失函数可视化与「损失地形」概念由此而来。

梯度与优化中的微积分

  • 梯度方向是函数上升最快的方向,所以参数沿负梯度更新:$\theta \leftarrow \theta - \eta\nabla_\theta L$,见优化与梯度下降
  • 学习率 $\eta$ 就是泰勒展开的步长:太大一步跨出可信区间(震荡/发散),太小收敛慢。

三、概率与统计

随机变量与分布

  • 随机变量/概率分布:$X \sim p(x)$,$p$ 描述取值可能性。模型输出 $p(y|x)$ 是对真实条件分布的逼近。
  • 期望与方差:$E[X] = \sum_x x p(x)$;$\text{Var}(X) = E[(X-E[X])^2]$。优化目标本质是最小化期望损失;方差对应「泛化差距」的随机性来源。
  • 常用分布:伯努利(二分类)、类别分布(多分类)、高斯分布 $N(\mu,\sigma^2)$(回归误差、初始化、扩散模型的加噪)。
  • 独立同分布(i.i.d.):训练集样本假设独立同分布——这个假设被破坏就是数据漂移,见评估实践

条件概率与贝叶斯

  • 条件概率:$P(A|B) = \frac{P(A\cap B)}{P(B)}$。分类器输出 $P(y|x)$ 就是条件概率。
  • 贝叶斯定理:$P(y|x) = \frac{P(x|y)P(y)}{P(x)}$。把「先验 $P(y)$ + 似然 $P(x|y)$」更新为「后验 $P(y|x)$」。VAE 的整个推导建立在「最大化数据似然 + 变分后验逼近」上,见VAE 与 GAN
  • 极大似然估计(MLE):$\hat\theta = \arg\max_\theta \prod_i p_\theta(x_i)$,等价于最小化负对数似然。交叉熵损失就是负对数似然——所以分类用交叉熵,本质是「最大化正确类概率」。

信息论

  • :$H(p) = -\sum_x p(x)\log p(x)$,分布的不确定性度量。
  • 交叉熵:$H(p,q) = -\sum_x p(x)\log q(x) = H(p) + D_{KL}(p|q)$。分类损失 = 真值分布与预测分布的交叉熵
  • KL 散度:$D_{KL}(p|q) = \sum_x p(x)\log\frac{p(x)}{q(x)}$,衡量分布差异,非对称($D_{KL}(p|q) \neq D_{KL}(q|p)$),恒 ≥ 0。KL 散度在 VAE(变分下界)、GAN、蒸馏、RLHF 中无处不在

交叉熵为什么配 softmax?

softmax 把 logits 归一化成概率分布 $q$;交叉熵损失对 logits 求导得到简洁的 $(p - q)$(真值减预测),梯度又大又稳定。而 MSE + softmax 在饱和区梯度趋零、训练极慢。详见损失函数与输出层页。

四、优化

  • 凸集与凸函数:$f(\lambda x + (1-\lambda)y) \le \lambda f(x) + (1-\lambda)f(y)$。凸函数无局部极小困扰(局部=全局)。神经网络损失非凸,所以才有初始化、学习率调度、动量这些「非凸时代的工程武器」,见优化与梯度下降页。
  • 梯度下降:$\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)$。三种变体:全量(GD)、mini-batch(实践标准)、随机(SGD)。
  • 动量:$\theta_{t+1} = \theta_t - \eta v_t$,$v_t = \beta v_{t-1} + (1-\beta)\nabla L$——对梯度做指数滑动平均,抑制震荡、加速平坦方向。
  • Adam:自适应调整每个参数的学习率(梯度一阶矩/二阶矩),对超参鲁棒。AdamW 修正权重衰减实现方式,大模型微调标配。
  • 鞍点 vs 局部极小:高维损失空间中鞍点(某些方向向下、某些向上)比局部极小常见得多——这也是随机性与动量有效的原因之一。
  • 学习率调度:warmup、cosine、step decay。Transformer 预训练几乎必配 warmup:初期参数随机、梯度噪声大,先小步走稳。

五、速查表:DL 公式速记

概念公式DL 场景
线性层$h = Wx + b$每一层的核心计算
注意力$\text{softmax}(QK^T/\sqrt{d_k})V$Transformer 核心,见Transformer 架构
交叉熵损失$L = -\sum_i y_i \log \hat{y}_i$分类任务标配损失
交叉熵梯度$\partial L/\partial z = \hat{y} - y$为什么训练稳定
L2 正则$L = L_0 + \lambda|\theta|_2^2$权重衰减
梯度更新$\theta \leftarrow \theta - \eta\nabla L$一切优化的起点
贝叶斯$P(yx) \propto P(x
KL 散度$\sum p\log(p/q)$生成模型与对齐

延伸阅读

参考资料