外观
DL vs ML vs AI vs 传统方法
一句话:人工智能(AI)是让机器模拟智能的总学科,机器学习(ML)是从数据中自动学习规律的一类 AI 方法,深度学习(DL)是用多层神经网络自动学习特征的机器学习子集——三个概念层层包含,即 AI ⊃ ML ⊃ DL;而"传统方法"则是除神经网络之外所有经典算法的统称。这套边界背后的动机与技术细节,见什么是深度学习与深度学习演进简史。
一、概念边界表
先把四个词放进一张表里对齐:
| 概念 | 一句话定义 | 典型方法 / 例子 |
|---|---|---|
| AI | 让机器完成需要智能的任务 | 专家系统(如 DENDRAL)、搜索与规划(IBM 深蓝)、机器学习、机器人学 |
| ML | 让机器从数据中学出规律 | 线性回归、决策树、SVM、K-近邻、梯度提升树(GBDT) |
| DL | 用多层神经网络自动学习表征 | AlexNet、BERT、GPT、AlphaFold |
| 传统方法 | 上述三列之外的经典算法总称 | 规则系统、统计模型、核方法、树模型、图算法 |
几个特别容易混淆的点:
- 深蓝不是机器学习。IBM 的深蓝(Deep Blue,1997)下棋靠的是暴力搜索 + 手工设计的评估函数,它"不会从对局数据中自动改进",属于经典的符号主义 AI。而 AlphaGo(2016)才真正把深度强化学习带入围棋——它从大量对局与自我对弈中学习价值函数,见深度强化学习。
- 符号主义 vs 连接主义是 AI 内部的两条路线:前者用规则、逻辑、知识图谱显式表示知识;后者(也就是深度学习所归属的方向)用神经网络从数据中隐式学知识。今天谈的"大模型"完全站在连接主义一侧。
- "传统方法"是个相对概念。SVM、随机森林在今天的产品里仍是常规组件,它们不"过时",只是被历史地称为传统。
二、深度学习内部的范式光谱
"深度学习"本身也不是铁板一块,按"学习信号从哪来"可以切成几种范式:
- 监督学习:训练样本带标签,学"输入 → 标签"的映射。图像分类、目标检测、机器翻译都属于此类,是当前工业落地的主力。
- 无监督学习:只有输入数据,学数据内部结构。聚类、降维、自编码器是典型。
- 自监督学习:从数据自身构造标签(下一 token 预测、掩码重建、对比学习),不需要人工标注——这是大模型时代的绝对主流,让"无标注数据"成为可以无限供应的燃料,原理见表征学习与预训练。
- 深度强化学习:从与环境交互得到的奖励信号中学习策略,见深度强化学习。
- 生成式建模:学习数据分布并从中采样出新样本,见生成式模型。
为什么这个区分重要
面试和工程里最常见的概念错位,就是把"深度学习"窄化为"监督分类"。实际上自监督预训练是 2018 年后几乎所有大模型的起点,不了解这一点,就无法理解现代深度学习的工作方式。
三、深度学习 vs 经典机器学习:对比表
| 维度 | 经典 ML | 深度学习 |
|---|---|---|
| 数据形态 | 表格、结构化数据为主 | 高维原始信号:图像像素、音频波形、文本 token |
| 数据量 | 数千至十万样本即可工作 | 通常需要数十万级以上,且遵循"越多越好" |
| 算力 | CPU 通常足够 | 依赖 GPU/TPU,训练成本高 |
| 特征工程 | 高度依赖人工设计 | 自动学习分层特征 |
| 可解释性 | 相对透明(线性、决策树) | 黑箱,需事后解释工具 |
| 训练时间 | 分钟至小时 | 小时至数周 |
两个补充事实。其一,深度学习在表格数据上并不天然占优:Kaggle 绝大多数表格竞赛的冠军是 GBDT(XGBoost / LightGBM / CatBoost),因为表格的每一列已经是"特征",深层组合的增益有限,而树模型在中小样本上过拟合更轻、训练更快。其二,两者不是二选一,实践中常见混合方案:用深度模型产出的 embedding 作为特征,再交给树模型做最终决策,这在推荐系统里尤其普遍(见深度学习推荐系统)。
四、深度学习 vs 神经网络:同义辨析
严格来说,"神经网络"是模型类,深度学习是使用多层神经网络做表征学习的机器学习子领域。两者并不完全等同:单层感知机(Rosenblatt,1958)是"神经网络",但通常不算"深度学习";RNN、CNN、Transformer 都是神经网络,也都属于深度学习的工具箱。
但在今天的日常语境里,"深度学习"与"深度神经网络"几乎同义,混用无伤大雅。容易造成误解的其实是一个反向问题:网络一定越深越好吗? 答案是否定的——ResNet 用残差连接把深度推到 152 层是因为有对应数据与训练技术支撑,普通任务上加层往往只是徒增过拟合。神经网络的结构与训练基础见神经网络基础。
五、深度学习 vs 大模型/基础模型
先定义:**基础模型(foundation model)**指在海量数据上大规模预训练、可通过微调或提示适配多种下游任务的模型;大模型是其中偏重规模的说法。GPT、Claude、Gemini、Llama、CLIP、Stable Diffusion 都属于这一类。
两者的关系可以概括为**"底层技术 vs 主导产品形态"**:
- 深度学习是技术底座——基础模型几乎全部基于 Transformer 架构(见Transformer 架构),并使用"预训练 → 适配(微调 / 提示工程 / RLHF)"的范式(见表征学习与预训练);
- 基础模型是深度学习在 2020 年代的市场化形态——它把"训练一次、处处适配"变成了产品逻辑,见大语言模型(LLM)。
一个容易搞混的边界是:"大模型"不等于"深度学习"。大模型只是深度学习范式在规模上的极端表现;深度学习的阵地还包括只有几十万参数的轻量模型、端侧推理模型等。反过来,也并非所有大模型都是"深度"的——但今天实际存在的大模型无一例外是深度 Transformer 网络。
六、数据形态决定选型:一把实践尺子
与其背结论,不如掌握判断方法。技术选型可以几乎完全由"数据形态"这一把尺子决定:
| 数据形态 | 首选方案 | 理由 |
|---|---|---|
| 表格数据 | GBDT 起步;数据量极大或含高基数类别时再试深度模型 | 列已是特征,树模型小样本更稳、更快、可解释 |
| 图像 | CNN 或视觉 Transformer(ViT),直接上深度学习 | 像素无人工特征可造,层级卷积天然匹配视觉 |
| 文本 / 序列 | Transformer / 预训练语言模型 | 自监督预训练范式已被验证到极致 |
| 图结构数据 | GNN(见图神经网络) | 邻接结构是树模型与 CNN 都无法直接消费的 |
| 行为序列 + 长期收益 | 强化学习或序列模型 + 业务规则 | 需要显式建模"决策→回报"的时间结构 |
| 决策 + 实时推理 | 深度模型蒸馏到轻量模型,或回到树模型 | 延迟与成本约束常常反过来决定选型 |
判断口诀:连续问三个问题——数据量大吗?输入是原始信号吗?任务有层级组合结构吗? 三个"是"越多,越该用深度学习;反之,从经典方法开始。数据规模与质量如何评估,见数据与数据工程。
七、权衡与边界
- 深度学习不是"更高级",只是"更适配某些场景"。小数据、强可解释、低延迟低成本场景下,经典方法往往是更优解。把深度学习当默认选项,是一种"工具迷信",DL 设计原则专门讨论如何从问题反推方案。
- 黑箱风险需要专门管理。深度模型的可解释性与公平性无法靠模型本身保证,需要事后解释工具与评测流程,见可解释性与公平性。
- 成本要算全账。训练、存储、推理、监控、再训练,每一环都是成本,工程侧见MLOps 与模型部署。
- 数据工程决定上限。无论模型多先进,数据泄漏、样本偏差、标注噪声都会让一切归零——这是数据与数据工程被列为核心概念的原因。
- 框架与生态是隐藏的取舍。PyTorch 的生态、JAX 的研究便利、推理引擎的部署性能,会实际影响团队的效率,见框架与工具怎么选。
延伸阅读
- 什么是深度学习——本文讨论的起点与展开
- 学习路径:三条路线——概念清楚之后,按目标选择学习路线
- 深度学习演进简史——理解这些概念如何在时间中分化与汇合
- Transformer 架构——大模型时代的架构底座
- 大语言模型(LLM)——基础模型范式的代表形态
- 术语表——AI/ML/DL 相关术语的统一索引