Skip to content

术语表

本页速览 深度学习核心术语速查词典:基础概念、模型与层、训练与优化、正则化、生成式与 LLM、评估与数据、生产与可信七组 60+ 条术语,含易混淆术语辨析与站内深入链接。

术语表

一句话定义:一份按主题分组的深度学习术语速查词典——七组共 60+ 条核心术语,每条给出中文名、英文名与一句话定义,易混淆的术语成对辨析,并加粗标出本手册的深入页面。

用法:阅读其他栏目遇到生词先来查定义;每组末尾的「辨析」成对对比易混词;需要深入理解时点加粗链接跳到对应页面。数学记号查数学基础速查

一、基础概念

术语定义
深度学习(Deep Learning)使用多层神经网络进行表征学习的机器学习方法,见什么是深度学习
表征学习(Representation Learning)让模型自动从数据中学习特征表示,而非手工设计特征,见表征学习与预训练
神经网络(Neural Network)由带可学习参数的层堆叠组成的函数逼近器,见神经网络基础
参数(Parameter)网络中的可学习权重与偏置,训练目标就是优化它们
超参数(Hyperparameter)训练前人为设定的参数:学习率、batch size、层数等
梯度(Gradient)损失对参数的偏导向量,指向损失上升最快的方向,反方向即下降方向,见优化与梯度下降
epoch / batch / iterationepoch=完整遍历一遍训练集;batch=一次迭代用的一批样本;iteration=一次参数更新
损失函数(Loss Function)衡量模型预测与真实标签差距的函数,训练即最小化它,见损失函数与输出层

辨析:epoch vs iteration——epoch 是「过完一遍全部数据」,iteration 是「更新一次参数」。10,000 样本、batch size 500,则每个 epoch 有 20 个 iteration。

二、模型与层

术语定义
MLP(多层感知机)由全连接层堆叠而成的最基础前馈网络
CNN(卷积神经网络)用卷积+池化提取局部特征、权值共享的网络,见CNN 与计算机视觉
RNN(循环神经网络)按时间步处理序列、隐状态在步间传递的网络,见RNN 与序列建模
LSTM / GRU引入门控机制缓解梯度消失的 RNN 变体
Transformer基于自注意力、可并行处理序列的架构,见Transformer 架构
注意力机制(Attention)按相关性加权聚合信息,核心是 QKV 查询-键-值机制,见注意力机制
Embedding(嵌入)将离散符号(词、ID)映射为稠密向量,作为模型输入表示
位置编码(Positional Encoding)为无序的自注意力注入序列位置信息的手段
残差连接(Residual/Skip Connection)跨层直连(x + F(x)),缓解深层梯度消失
归一化层(BN/LN)BatchNorm 沿 batch 归一化、LayerNorm 沿特征归一化,见初始化与归一化
感知野(Receptive Field)输出神经元对应的输入区域大小

辨析:BatchNorm vs LayerNorm——BN 依赖 batch 统计,适合图像;LN 与 batch 无关,适合序列/变长输入,因此 Transformer 用 LN。

三、训练与优化

术语定义
反向传播(Backpropagation)用链式法则高效计算梯度的算法,见反向传播与自动微分
梯度下降(Gradient Descent)沿梯度反方向迭代更新参数的优化方法
SGD(随机梯度下降)用一小批(mini-batch)样本估计梯度,兼顾效率与随机性
Momentum(动量)累积历史梯度方向,加速收敛并抑制震荡
Adam / AdamW自适应学习率优化器;AdamW 修正了 Adam 的权重衰减实现,是预训练/微调标配
学习率调度(LR Schedule)训练中动态调整学习率:cosine、warmup、step decay 等,见训练配方与调参
梯度裁剪(Gradient Clipping)梯度范数超限时缩放,防梯度爆炸
混合精度(Mixed Precision)FP16/BF16 与 FP32 混合计算,省显存提速
初始化(Initialization)Xavier/Kaiming 等按层尺度设定权重初值,见初始化与归一化
学习率(Learning Rate)每次参数更新的步长,最敏感的超参数
损失面 / 局部极小(Loss Landscape / Local Minima)高维损失空间的几何结构;实践中「鞍点与平坦区域」比局部极小更常见

辨析:GD vs SGD vs mini-batch SGD——GD 用全量数据算一次梯度(准但慢);SGD 严格意义上每样本一更新(噪音大);实践用的是 mini-batch SGD(折中)。说「SGD」通常指 mini-batch SGD。

四、正则化

术语定义
过拟合(Overfitting)模型记住训练集噪声,泛化差,见过拟合与正则化
欠拟合(Underfitting)模型容量不足,训练集都拟合不好
Dropout训练时随机丢弃部分神经元,防止共适应
权重衰减(Weight Decay / L2)给大权重加惩罚,使模型更平滑
数据增强(Data Augmentation)对训练样本做变换产生新样本,见数据与数据工程
早停(Early Stopping)验证集指标不再提升即停止训练
批归一化作为正则化BN 引入的噪声(batch 统计波动)有轻微正则效果(学界有争议,不依赖此效果)
泛化(Generalization)模型在未见数据上的表现能力,训练的根本目标

辨析:正则化 vs 数据增强——正则化约束模型复杂度(改模型/损失),数据增强扩充数据分布(改数据)。两者可叠加,不冲突。

五、生成式与 LLM

术语定义
VAE(变分自编码器)编码-解码 + 隐空间正则化的生成模型,见VAE 与 GAN
GAN(生成对抗网络)生成器与判别器对抗训练,见VAE 与 GAN
扩散模型(Diffusion Model)学习逐步去噪的生成模型,见扩散模型与生成式 AI
预训练(Pre-training)在大规模无标注/弱标注数据上训练通用能力,见表征学习与预训练
微调(Fine-tuning)在预训练模型上用小规模任务数据继续训练
LoRA / PEFT低秩适配/参数高效微调:只训练少量新增参数
RLHF(人类反馈强化学习)用人类偏好训练奖励模型,再强化学习对齐模型行为
RAG(检索增强生成)检索外部知识辅助生成,缓解幻觉与时效问题
幻觉(Hallucination)大模型生成看似合理但错误的/无依据的内容
上下文窗口(Context Window)模型一次可处理的输入 token 上限
Token文本切分后的基本单位,中文字常 1 字≈1-2 token
KV cache自回归解码缓存已生成 token 的键值,加速推理

辨析:预训练 vs 微调 vs RAG——预训练学通用知识(重成本)、微调注入任务/风格(中等成本、改参数)、RAG 引入即时外部知识(不改参数)。三者解决不同问题,详见大语言模型(LLM)

六、评估与数据

术语定义
准确率/精确率/召回率/F1分类核心指标;精确率=预测正类中对的占比,召回率=真实正类中被找出的占比,F1 是二者调和平均,见深度学习评估与实验
AUC(ROC 曲线下面积)度量排序能力的指标,对类别不平衡稳健
混淆矩阵(Confusion Matrix)预测 vs 真实的分类型计数表
FID(Fréchet Inception Distance)生成图像与真实图像分布距离的度量,评估 GAN/扩散模型
困惑度(Perplexity)语言模型对文本的惊讶程度度量(越低越好)
数据泄露(Data Leakage)训练信息泄漏到测试集导致评估虚高,见常见陷阱与反模式
数据不平衡(Class Imbalance)类别样本数悬殊,需重采样/加权损失处理
交叉验证(Cross-validation)数据分折轮流作验证集,小数据场景常用
离线/在线评估(Offline/Online Eval)静态数据集上的评估 vs 线上真实流量上的指标

辨析:精确率 vs 召回率——「预测的正类中有多少是真」vs「真实的正类中有多少被找出」。垃圾邮件场景两者都重要,医疗筛查场景更看重召回率(别漏诊)。

七、生产与可信

术语定义
MLOps模型开发到上线的工程化体系:实验管理、CI/CD、监控、回滚,见MLOps 与模型部署
量化(Quantization)将模型权重从 FP32 降为 INT8 等低精度以加速、省显存
蒸馏(Distillation)用大模型(教师)输出指导小模型(学生)训练
剪枝(Pruning)移除不重要的权重/神经元压缩模型
推理(Inference)训练完成后用模型做预测,与训练相对
分布式训练(Distributed Training)数据并行/模型并行/张量并行等跨设备训练方式,见训练配方与调参
可解释性(Interpretability)理解模型决策原因的能力,见可解释性与公平性
公平性(Fairness)模型在不同群体上表现无系统性偏差
鲁棒性(Robustness)模型在分布偏移/对抗扰动下保持性能的能力
漂移(Drift)线上数据分布随时间变化导致模型退化
基准(Benchmark)标准数据集与指标,用于横向比较模型能力

辨析:量化 vs 蒸馏 vs 剪枝——量化改数值精度、蒸馏改学习目标(向教师学)、剪枝改结构(删冗余)。三者可叠加使用,是模型上线前的三件套。

使用建议

  1. 阅读其他页面遇到术语先查本表拿一句话定义,再点加粗链接深入;
  2. 面试前把七组过一遍,重点背「辨析」对——面试官最爱问成对对比;
  3. 发现不认识的术语属于JD 知识点拆解里的技能词时,立即标进补课清单。

延伸阅读

参考资料