外观
面试题库
一句话定义:一份按七个维度组织的深度学习面试题库——每题给出「答题要点 + 关联页面」,既是面试前自测清单,也是检验JD 知识点拆解补课成果的考卷。
用法建议:不要按顺序背题。先对照自己的补课清单挑薄弱维度,每道题先自己讲一遍(录音或对着镜子),再对答案要点。每题答满 3 分钟、能扛住一次追问,才算过关。
一、基础概念(必考,答不上直接挂)
1. 什么是反向传播?它为什么高效?
答题要点:反向传播用链式法则按「输出→输入」的顺序复用中间梯度,一次前向 + 一次反向即可算出所有参数的梯度,复杂度与参数数量成正比而非按层数指数增长。与数值微分(O(n) 次前向)对比讲效率差异即可。
关联页面:反向传播与自动微分。
2. 如何选择激活函数?ReLU 为什么流行?
答题要点:ReLU 计算快、缓解梯度消失(正区间导数为 1)、引入稀疏性;缺点负区间导数恒 0 导致「神经元死亡」,可配合 Leaky ReLU。Sigmoid 只用在二分类输出层,Tanh 输出以 0 为中心优于 Sigmoid 隐藏层。输出层激活由任务决定:回归线性、二分类 Sigmoid、多分类 Softmax,见损失函数与输出层。
关联页面:神经网络基础。
3. 模型过拟合了怎么办?
答题要点:按优先级回答——加数据/数据增强、降模型容量、加正则化(权重衰减、Dropout)、早停、集成;并说清每招为什么有效(增加泛化、减少方差)。最好结合自己项目讲一次真实过拟合排查。详见过拟合与正则化。
4. 训练集 loss 低、验证集 loss 高,和两者都高,分别是什么问题?
答题要点:前者是过拟合(高方差),后者是欠拟合/模型容量不足(高偏差)。先判断再对症:过拟合加正则化/数据,欠拟合加容量/加训练轮数。评估方法论见深度学习评估与实验。
5. 什么是一般机器学习流程?数据预处理为什么要做归一化?
答题要点:数据→预处理→建模→评估→迭代。归一化让各特征尺度一致,避免梯度更新被大尺度特征主导、加快收敛;树模型则不受影响。数据侧更多细节见数据与数据工程。
二、架构
6. 写出 Transformer 中注意力的公式并解释每部分。(必考)
答题要点:Attention(Q,K,V) = softmax(QKᵀ/√d_k)V。Q、K、V 由输入经线性投影得到;QKᵀ 衡量相似度;除以 √d_k 防止点积随维度增大而爆炸导致 softmax 饱和;softmax 归一化为权重;加权求和 V。能推导为什么除以 √d_k 是加分点。
关联页面:Transformer 架构、注意力机制。
7. 什么是感受野?如何增大?
答题要点:感受野是输出某神经元对应的输入区域大小。增大方式:加深网络、池化/步长卷积、膨胀卷积;深层小卷积核堆叠可近似大核效果且参数更少。详见CNN 与计算机视觉。
8. RNN 与 Transformer 处理序列有什么区别?位置编码起什么作用?
答题要点:RNN 顺序处理、无法并行、长程依赖易梯度消失(LSTM/GRU 缓解);Transformer 自注意力全局建模、可并行,但失去顺序信息,需要位置编码。绝对位置编码(sinusoidal)与相对位置编码(RoPE 等)的区别是进阶加分点。详见RNN 与序列建模。
9. 卷积为什么比全连接更适合图像?
答题要点:局部连接 + 权重共享(平移等变性)+ 参数量少,匹配图像的局部相关性先验;对应归纳偏置概念。能讲到「这个归纳偏置也是 ViT 需要更多数据才能追平 CNN 的原因」就是亮点。
三、训练
10. Adam 和 SGD 的区别?什么时候用哪个?
答题要点:Adam 自适应学习率(一阶矩 + 二阶矩估计),收敛快、对初始学习率不敏感;SGD+Momentum 收敛慢但泛化更好、对超参更敏感。实践中:大模型微调常用 AdamW;调参后期或追求泛化可换 SGD。能展开讲 AdamW 为什么在权重衰减上修正 Adam 是加分点。详见优化与梯度下降。
11. 学习率太大或太小分别会怎样?常见学习率调度有哪些?
答题要点:太大不收敛/震荡,太小收敛慢或卡在局部极小。常见调度:step decay、cosine annealing、warmup(大模型训练必备)、ReduceLROnPlateau。能讲 warmup 为什么对 Transformer 重要(训练初期梯度方差大)是加分点。
关联页面:训练配方与调参。
12. 梯度消失/爆炸怎么出现、怎么解决?
答题要点:深层网络反向传播是连乘,激活函数导数 <1 或权重矩阵谱半径 >1 导致梯度指数级衰减/放大。解决:合理初始化(Xavier/Kaiming)、归一化(BN/LN)、残差连接、ReLU 族激活、梯度裁剪(爆炸)。详见初始化与归一化与调试与诊断。
13. BatchNorm 与 LayerNorm 的区别?Transformer 为什么用 LN?
答题要点:BN 沿 batch 维度归一化,依赖 batch 统计,训练/推理行为不同,对 batch size 敏感;LN 沿特征维度归一化,与 batch 无关。Transformer 用 LN 是因为序列长度可变、batch 常受限于显存较小。能展开「BN 对 NLP 失效、对图像生效」的讨论更佳。
四、数学
14. 矩阵求导:给出 dL/dW 的一般推导思路。
答题要点:用标量对矩阵的链式法则,从损失标量出发逐层展开;能写出 y = Wx,L = f(y) 时 dL/dW = dL/dy · xᵀ 即可;关键是维度对齐(前向传播形状与梯度形状一致)。系统查漏见数学基础速查。
15. 交叉熵损失为什么配 softmax?
答题要点:softmax 将 logits 转成概率分布且可微;交叉熵对 softmax 输入求导得到漂亮的 (p - y)(预测减真实 one-hot),梯度简单稳定,避免了 MSE+softmax 的梯度饱和问题。推导见损失函数与输出层。
16. 什么是条件概率与贝叶斯定理?分类任务里如何理解后验概率?
答题要点:P(A|B) = P(B|A)P(A)/P(B)。分类输出可看作后验概率 P(y|x);能讲朴素贝叶斯为什么「朴素」(特征条件独立假设)是加分点。见数学基础速查。
17. KL 散度是什么?训练 GAN 时它扮演什么角色?
答题要点:KL 散度衡量两个分布的差异,非对称、≥0(等于 0 当且仅当分布相同)。GAN 生成器最小化生成分布与真实分布的某种散度(原始 GAN 等价于最小化 JS 散度的变体);扩散模型的变分下界也与 KL 相关。详见VAE 与 GAN。
五、工程
18. 数据增强有哪些常见方法?什么时候不能用?
答题要点:图像——翻转、裁剪、旋转、颜色抖动、MixUp/CutMix;文本——回译、同义词替换、EDA;注意任务语义约束(OCR 不能水平翻转文字、医学图像不能随意裁剪)。见数据与数据工程。
19. 混合精度训练(FP16/BF16)的原理与坑?
答题要点:用低精度存储/计算加快训练、省显存,关键组件是 loss scaling 防止下溢;BF16 与 FP16 在指数位/尾数位上不同,BF16 对大模型更稳。坑:部分算子精度敏感需保持 FP32(如 BN 统计、部分归一化层)。详见训练配方与调参。
20. 模型显存不够怎么优化?
答题要点:减 batch size/梯度累积、混合精度、梯度检查点(用计算换显存)、减小模型(蒸馏/剪枝/量化)、优化数据加载。能给出实际数字(如梯度检查点省 60% 显存但慢 30%)是加分点。
21. 训练和推理有什么区别?推理优化有哪些手段?
答题要点:训练有反向传播、需要梯度、常分布式;推理只前向、追求低延迟高吞吐。推理优化:量化(INT8)、蒸馏、剪枝、算子融合、KV cache、批量调度。详见MLOps 与模型部署。
六、大模型
22. 微调(Fine-tuning)与 RAG 有什么区别?怎么选?
答题要点:微调改变模型参数(知识/风格注入),RAG 不改参数、靠检索外部知识(时效性强、可解释、更新便宜)。选择逻辑:知识时效性/私有性→RAG;行为风格/任务格式→微调;常组合使用。详见大语言模型(LLM)。
23. 大模型为什么会有幻觉?怎么缓解?
答题要点:本质是语言模型生成「概率上合理」文本而非事实检索;缓解——RAG 引入证据、微调对齐、解码约束、评测与兜底策略。能区分「事实幻觉」与「推理错误」是加分点。
24. 什么是 KV cache?它为什么重要?
答题要点:自回归解码时已生成的 token 的 Key/Value 可缓存复用,避免重复计算,换取显存开销;长上下文场景下 KV cache 成为显存瓶颈,引出 MQA/GQA、量化 KV 等优化。这是「大模型推理面试」的高频深挖点。
25. LoRA 为什么能省显存?
答题要点:冻结原权重,只训练低秩增量 ΔW = BA(B∈R^{d×r}, A∈R^{r×k}, r≪d),可训练参数减少几个数量级,可插拔切换任务;展开讲秩 r 的选择与任务关系是加分点。见大语言模型(LLM)。
七、开放题(考察系统设计)
26. 如何设计一个图像分类系统?
答题要点:按全流程回答——需求与指标(准确率/延迟/成本权衡)→数据(采集/标注/质检/类别平衡)→模型选型(CNN vs ViT、规模)→训练(迁移学习、调参)→评估(分层指标、badcase 分析)→部署(服务化/端侧、监控与回滚)。考察点是「有没有完整闭环思维」,不是某一步做到极致。参考从零构建一个深度学习项目。
27. 线上模型效果比离线差,怎么排查?
答题要点:数据分布漂移(特征缺失/取值变化)→线上实现 bug(预处理不一致)→评估口径不一致(离线/在线标签定义)→业务环境变化(用户行为改变)。给出一份「按概率排序的排查清单」是高分答案。见调试与诊断。
28. 给你的模型做一个评测方案,怎么做?
答题要点:明确评测目标(能力/鲁棒性/公平性)→选指标与基准集→设计对抗与边界测试→自动化评测管道→定期回归。能引用评估实践的「指标选择先于实验」原则是加分点。
八、面试礼仪与答题节奏
- 先给结论再展开:一句话结论 + 2-3 条理由 + 一个例子;
- 不会的题诚实说:「这个领域我没做过,我的理解是……」,比硬编强;
- 准备 2 个「讲得深」的项目:每个项目能连续讲 15 分钟、扛得住 5 轮追问,比 5 个讲不深的项目值钱;
- 反问环节准备 2-3 个问题:问团队分工、评估标准、技术栈,体现对岗位的真实兴趣。
延伸阅读
- JD 知识点拆解——按补课清单定位薄弱维度
- 能力对标:简历该突出什么——面试前自测简历上的每个词
- 训练配方与调参——训练类题目的系统底稿
- 数学基础速查——数学类题目的查漏工具
- 大语言模型(LLM)——大模型类题目的知识底座
- 评估实践——开放题与评估题的方法论