外观
ML vs AI vs 深度学习 vs 数据科学
这是被问得最多、也最容易答混的一组概念。先给结论:人工智能是目标,机器学习是手段之一,深度学习是机器学习的一个分支,数据科学是更大的流程。四者是"包含"关系,不是并列关系。
一、一张图看懂包含关系
人工智能 AI(让机器表现智能)
├── 符号主义:规则系统、知识图谱、专家系统、搜索
├── 机器学习 ML(从数据中学习规律)
│ ├── 经典机器学习:线性模型、树、SVM、聚类…
│ ├── 深度学习 DL(多层神经网络)
│ │ ├── CNN / RNN / Transformer / GNN…
│ │ └── 生成式模型:GAN、VAE、扩散模型
│ └── 强化学习 RL(学决策序列)
└── 其他:感知、机器人控制、规划…
数据科学(用数据支撑决策的完整流程)
├── 数据采集与清洗
├── 数据分析与可视化 ← 机器学习常嵌入于此
├── 机器学习建模 ← 本手册重点
├── 实验设计(AB 测试)
└── 业务报告与决策支持关键判断:不是所有 AI 都是机器学习(下棋的 minimax 搜索、医疗的规则诊断系统都是 AI 但不是 ML);也不是所有机器学习都是深度学习(XGBoost、逻辑回归不是深度学习);更不是所有数据科学都涉及机器学习(画一张销售趋势图也是数据科学)。
二、四个概念逐一拆解
人工智能(Artificial Intelligence, AI)
定义:让机器完成"需要人类智能才能完成"的任务的研究与工程,目标词。
AI 的范畴远大于机器学习,包含几十个子领域:知识表示、自动推理、搜索与规划、自然语言处理(NLP)、计算机视觉(CV)、机器人学、语音识别、多智能体系统……机器学习只是让机器获得智能的一条路径——而且历史上不是主流。1950s–1980s 的主流是符号主义(symbolic AI):把人类知识编码成显式规则,让机器按规则推理。专家系统(如 1980 年代医疗诊断系统 MYCIN)就是那个时代的代表。
转折点在 1990s–2010s:人们发现"手写规则"在感知类任务(图像、语音)上根本写不出来——你怎么用规则描述"这是一只猫"?于是统计学习、机器学习接管,并最终由深度学习在感知任务上取得突破。今天,"AI" 一词在媒体语境下几乎特指"机器学习/深度学习驱动的系统",但学术意义上它始终是更大的伞。
机器学习(Machine Learning, ML)
定义:让计算机从数据中自动发现规律并用于预测/决策的学科(详见什么是机器学习)。
与 AI 的关系:ML ⊂ AI,且是当前最成功、占比最大的子领域。AI 的其他分支(规则系统、搜索)与 ML 的区别在于"知识从哪来":规则系统由人写规则,ML 由数据生成规则。
深度学习(Deep Learning, DL)
定义:用多层神经网络(deep neural networks)做表征学习的机器学习分支。核心思想是端到端表征学习:传统 ML 依赖人手工设计特征(feature engineering),深度学习让网络自己从原始数据中逐层学习特征——浅层学边缘/笔画,中层学部件/短语,深层学对象/语义。
与 ML 的关系:DL ⊂ ML。DL 的特点与代价:
| 维度 | 经典机器学习 | 深度学习 |
|---|---|---|
| 特征 | 人工设计(特征工程) | 自动学习(表征学习) |
| 数据需求 | 相对少(千~十万级) | 很大(十万~十亿级) |
| 计算需求 | 笔记本可跑 | GPU/TPU 集群 |
| 适用数据 | 表格数据为主 | 图像、文本、语音、序列 |
| 可解释性 | 较好(树、线性) | 差(黑箱) |
| 代表 | 线性回归、SVM、XGBoost | CNN、Transformer、LLM |
重要提醒:DL 不是"更好的 ML",而是"另一类数据上的 ML"。Kaggle 的长期经验是:表格数据上梯度提升树(XGBoost/LightGBM)经常打败神经网络;非结构化数据(图像、文本、音频)上深度学习碾压经典方法。选型逻辑详见框架与工具怎么选。
数据科学(Data Science)
定义:用数据(通常是大规模、多来源、脏数据)回答业务问题、支持决策的完整流程学科。
数据科学的四个环节:采集与清洗 → 分析与探索(EDA)→ 建模(可能用 ML)→ 沟通与决策。机器学习和统计建模只是其中一环。数据科学家与机器学习工程师(MLE)的分工差异:
| 数据科学家(DS) | 机器学习工程师(MLE) | |
|---|---|---|
| 重心 | 业务问题 → 分析 → 洞察 → 建议 | 模型 → 系统 → 部署 → 监控 |
| 日常 | 写 SQL、做 EDA、跑模型、画图汇报 | 写训练管道、调优、上线服务、监控漂移 |
| 交付物 | 报告、看板、可解释的结论 | 稳定运行的模型服务(API/批处理) |
| 编程 | Python/R + SQL | Python + 工程化(Docker、CI/CD、分布式) |
国内岗位现实中 DS 和 MLE 经常重叠,但理解这条分界线有助于你对照 JD 判断岗位偏重。
三、再补两个常被混用的词
数据分析(Data Analytics):数据科学的子集,特指"描述性分析"——回答"发生了什么"(同比涨跌、漏斗转化、用户分层),一般不涉及预测建模。分析是数据科学的起点,建模是延伸。
统计建模(Statistical Modeling):用统计工具(回归、假设检验、贝叶斯)刻画数据生成机制。它与机器学习共享大量数学工具,但目标不同:统计求"推断"(因果、显著性),机器学习求"预测"(泛化误差)。两者互补:统计保证你理解数据怎么来的,机器学习保证你能规模化地用数据。参见什么是机器学习中"机器学习 vs 统计学"一节。
四、判据速查表
| 问题 | 答案 |
|---|---|
| AI 一定是机器学习吗? | 不是。规则系统、搜索、知识图谱都是 AI 但不是 ML |
| 机器学习一定是 AI 吗? | 是。ML 是 AI 的子领域 |
| 深度学习是机器学习吗? | 是。DL 是 ML 用深度神经网络的子分支 |
| 数据科学一定是机器学习吗? | 不是。DS 是更大流程,ML 常作为其中一环 |
| 数据分析是机器学习吗? | 通常不是。分析是描述性的,ML 是预测性的 |
| 用了神经网络就是深度学习吗? | 是(多层即深度)。单层感知机不算深度模型 |
| 大语言模型属于什么? | AI → ML → DL → Transformer 架构的预训练模型,详见大语言模型 |
五、对从业者的实际意义
求职方向选择:这四个词直接对应四种岗位画像——
- 想做"AI 科学家":需要 ML + DL + 数学功底,偏研究与论文;
- 想做"机器学习工程师":需要 ML + 工程化(训练管道、部署、监控),偏落地;
- 想做"数据科学家":需要 SQL + 统计 + 分析 + 可视化 + 沟通,业务敏感度要求高;
- 想做"深度学习/算法研究员":需要 DL + 论文阅读 + 复现实验能力,门槛最高。
岗位与 JD 的具体拆解见求职与 JD 分析。
技术选型意义:理解这四个概念的分层,能帮你快速定位"我的问题属于哪一层"。面试官问"你们为什么用 XGBoost 不用深度学习",期望的答案不是"深度学习更高级",而是:"这是表格数据、样本量有限、需要特征重要性解释,所以选择树模型——深度学习更适合非结构化数据。" 判断依据详见树模型与集成学习。
延伸阅读
- 什么是机器学习——本文的上游概念,四要素定义
- 演进简史——AI/ML/DL 三代范式如何交替登场
- 深度学习基础——DL 子集的技术内核
- 数据与数据工程——数据科学流程的工程底座
- 术语表——更多易混术语对(如 ML vs DL vs RL)
参考资料
- Artificial Intelligence: A Modern Approach (AIMA), Russell & Norvig —— AI 学科最权威教材,AI 范畴的完整地图
- Andrew Ng. AI is the new electricity(斯坦福演讲) —— 对 AI/ML 分层关系的通俗讲解
- Kaggle: XGBoost vs Neural Network 实践讨论 —— 表格数据上树模型强于神经网络的经验证据
- Data Science: A Comprehensive Overview, UC Berkeley —— 数据科学流程的经典教材