Skip to content

DL vs ML vs AI vs 传统方法

本页速览 厘清人工智能、机器学习、深度学习与经典算法的概念边界和真实分工,并用"数据形态"这把尺子给出可操作的选型判断:什么场景该上深度模型,什么场景该用 GBDT。

DL vs ML vs AI vs 传统方法

一句话:人工智能(AI)是让机器模拟智能的总学科,机器学习(ML)是从数据中自动学习规律的一类 AI 方法,深度学习(DL)是用多层神经网络自动学习特征的机器学习子集——三个概念层层包含,即 AI ⊃ ML ⊃ DL;而"传统方法"则是除神经网络之外所有经典算法的统称。这套边界背后的动机与技术细节,见什么是深度学习深度学习演进简史

一、概念边界表

先把四个词放进一张表里对齐:

概念一句话定义典型方法 / 例子
AI让机器完成需要智能的任务专家系统(如 DENDRAL)、搜索与规划(IBM 深蓝)、机器学习、机器人学
ML让机器从数据中学出规律线性回归、决策树、SVM、K-近邻、梯度提升树(GBDT)
DL用多层神经网络自动学习表征AlexNet、BERT、GPT、AlphaFold
传统方法上述三列之外的经典算法总称规则系统、统计模型、核方法、树模型、图算法

几个特别容易混淆的点:

  • 深蓝不是机器学习。IBM 的深蓝(Deep Blue,1997)下棋靠的是暴力搜索 + 手工设计的评估函数,它"不会从对局数据中自动改进",属于经典的符号主义 AI。而 AlphaGo(2016)才真正把深度强化学习带入围棋——它从大量对局与自我对弈中学习价值函数,见深度强化学习
  • 符号主义 vs 连接主义是 AI 内部的两条路线:前者用规则、逻辑、知识图谱显式表示知识;后者(也就是深度学习所归属的方向)用神经网络从数据中隐式学知识。今天谈的"大模型"完全站在连接主义一侧。
  • "传统方法"是个相对概念。SVM、随机森林在今天的产品里仍是常规组件,它们不"过时",只是被历史地称为传统。

二、深度学习内部的范式光谱

"深度学习"本身也不是铁板一块,按"学习信号从哪来"可以切成几种范式:

  • 监督学习:训练样本带标签,学"输入 → 标签"的映射。图像分类、目标检测、机器翻译都属于此类,是当前工业落地的主力。
  • 无监督学习:只有输入数据,学数据内部结构。聚类、降维、自编码器是典型。
  • 自监督学习:从数据自身构造标签(下一 token 预测、掩码重建、对比学习),不需要人工标注——这是大模型时代的绝对主流,让"无标注数据"成为可以无限供应的燃料,原理见表征学习与预训练
  • 深度强化学习:从与环境交互得到的奖励信号中学习策略,见深度强化学习
  • 生成式建模:学习数据分布并从中采样出新样本,见生成式模型

为什么这个区分重要

面试和工程里最常见的概念错位,就是把"深度学习"窄化为"监督分类"。实际上自监督预训练是 2018 年后几乎所有大模型的起点,不了解这一点,就无法理解现代深度学习的工作方式。

三、深度学习 vs 经典机器学习:对比表

维度经典 ML深度学习
数据形态表格、结构化数据为主高维原始信号:图像像素、音频波形、文本 token
数据量数千至十万样本即可工作通常需要数十万级以上,且遵循"越多越好"
算力CPU 通常足够依赖 GPU/TPU,训练成本高
特征工程高度依赖人工设计自动学习分层特征
可解释性相对透明(线性、决策树)黑箱,需事后解释工具
训练时间分钟至小时小时至数周

两个补充事实。其一,深度学习在表格数据上并不天然占优:Kaggle 绝大多数表格竞赛的冠军是 GBDT(XGBoost / LightGBM / CatBoost),因为表格的每一列已经是"特征",深层组合的增益有限,而树模型在中小样本上过拟合更轻、训练更快。其二,两者不是二选一,实践中常见混合方案:用深度模型产出的 embedding 作为特征,再交给树模型做最终决策,这在推荐系统里尤其普遍(见深度学习推荐系统)。

四、深度学习 vs 神经网络:同义辨析

严格来说,"神经网络"是模型类,深度学习是使用多层神经网络做表征学习的机器学习子领域。两者并不完全等同:单层感知机(Rosenblatt,1958)是"神经网络",但通常不算"深度学习";RNN、CNN、Transformer 都是神经网络,也都属于深度学习的工具箱。

但在今天的日常语境里,"深度学习"与"深度神经网络"几乎同义,混用无伤大雅。容易造成误解的其实是一个反向问题:网络一定越深越好吗? 答案是否定的——ResNet 用残差连接把深度推到 152 层是因为有对应数据与训练技术支撑,普通任务上加层往往只是徒增过拟合。神经网络的结构与训练基础见神经网络基础

五、深度学习 vs 大模型/基础模型

先定义:**基础模型(foundation model)**指在海量数据上大规模预训练、可通过微调或提示适配多种下游任务的模型;大模型是其中偏重规模的说法。GPT、Claude、Gemini、Llama、CLIP、Stable Diffusion 都属于这一类。

两者的关系可以概括为**"底层技术 vs 主导产品形态"**:

  • 深度学习是技术底座——基础模型几乎全部基于 Transformer 架构(见Transformer 架构),并使用"预训练 → 适配(微调 / 提示工程 / RLHF)"的范式(见表征学习与预训练);
  • 基础模型是深度学习在 2020 年代的市场化形态——它把"训练一次、处处适配"变成了产品逻辑,见大语言模型(LLM)

一个容易搞混的边界是:"大模型"不等于"深度学习"。大模型只是深度学习范式在规模上的极端表现;深度学习的阵地还包括只有几十万参数的轻量模型、端侧推理模型等。反过来,也并非所有大模型都是"深度"的——但今天实际存在的大模型无一例外是深度 Transformer 网络。

六、数据形态决定选型:一把实践尺子

与其背结论,不如掌握判断方法。技术选型可以几乎完全由"数据形态"这一把尺子决定:

数据形态首选方案理由
表格数据GBDT 起步;数据量极大或含高基数类别时再试深度模型列已是特征,树模型小样本更稳、更快、可解释
图像CNN 或视觉 Transformer(ViT),直接上深度学习像素无人工特征可造,层级卷积天然匹配视觉
文本 / 序列Transformer / 预训练语言模型自监督预训练范式已被验证到极致
图结构数据GNN(见图神经网络邻接结构是树模型与 CNN 都无法直接消费的
行为序列 + 长期收益强化学习或序列模型 + 业务规则需要显式建模"决策→回报"的时间结构
决策 + 实时推理深度模型蒸馏到轻量模型,或回到树模型延迟与成本约束常常反过来决定选型

判断口诀:连续问三个问题——数据量大吗?输入是原始信号吗?任务有层级组合结构吗? 三个"是"越多,越该用深度学习;反之,从经典方法开始。数据规模与质量如何评估,见数据与数据工程

七、权衡与边界

  • 深度学习不是"更高级",只是"更适配某些场景"。小数据、强可解释、低延迟低成本场景下,经典方法往往是更优解。把深度学习当默认选项,是一种"工具迷信",DL 设计原则专门讨论如何从问题反推方案。
  • 黑箱风险需要专门管理。深度模型的可解释性与公平性无法靠模型本身保证,需要事后解释工具与评测流程,见可解释性与公平性
  • 成本要算全账。训练、存储、推理、监控、再训练,每一环都是成本,工程侧见MLOps 与模型部署
  • 数据工程决定上限。无论模型多先进,数据泄漏、样本偏差、标注噪声都会让一切归零——这是数据与数据工程被列为核心概念的原因。
  • 框架与生态是隐藏的取舍。PyTorch 的生态、JAX 的研究便利、推理引擎的部署性能,会实际影响团队的效率,见框架与工具怎么选

延伸阅读

参考资料