第2章 AI、机器学习、深度学习:到底什么关系?
一句话点题: 这三个词不是并列的,是"俄罗斯套娃"——一层包一层。AI最大,机器学习是AI里面的一种方法,深度学习是机器学习里面的一种方法。
写在前面
你可能经常看到这样的说法:
- “AI将取代人类工作”
- “机器学习正在改变金融行业”
- “深度学习实现了人脸识别”
这三个词经常被混着用,好像说的是同一件事。媒体这么干也就算了,但如果你自己搞开发也分不清,那选技术方案的时候就会犯迷糊:我到底需要AI?机器学习?还是深度学习?
这章的目标就一个:让你看完之后再也不会把这三个词搞混。
一、先看全景:三个圈的关系
用一张图就能说清楚:
┌─────────────────────────────────────────┐
│ 人工智能 (AI) │
│ │
│ ┌───────────────────────────────┐ │
│ │ 机器学习 (ML) │ │
│ │ │ │
│ │ ┌───────────────────────┐ │ │
│ │ │ 深度学习 (DL) │ │ │
│ │ │ │ │ │
│ │ └───────────────────────┘ │ │
│ │ │ │
│ │ (ML里还有其他方法) │ │
│ └───────────────────────┬───────┘ │
│ │ │
│ (AI里还有其他方法) │ │
│ │ │
└───────────────────────────┴─────────────┘
三个圈,从外到内:
- AI(人工智能):最大的圈,指的是"让机器表现得像人一样聪明"这个总目标
- ML(机器学习):AI里面的一个子集,是实现AI的一种方法
- DL(深度学习):ML里面的一个子集,是机器学习的一种具体技术
打个生活中的比方:
| 概念 | 对应的比方 | 大白话 |
|---|---|---|
| AI | “做饭” | 一个大目标,就是做出好吃的饭 |
| ML | “炒菜” | 做饭的一种方式,不是唯一方式(你也可以蒸、煮、烤) |
| DL | “铁锅猛火炒” | 炒菜的一种具体手法,效果猛但门槛高 |
你说"我在做饭",别人不知道你是炒是蒸还是煮。你说"我在炒菜",范围缩小了。你说"我用铁锅猛火炒",非常具体。
同理:
- 你说"我在做AI",可能是在写if-else规则,也可能在训练大模型
- 你说"我在做机器学习",说明你是让机器从数据里学,但用的可能决策树也可能神经网络
- 你说"我在做深度学习",非常明确,你在用多层神经网络
二、AI(人工智能):最大的那个圈
1. AI到底是什么
AI不是一个具体的技术,而是一个目标——让机器表现出类似人类的智能行为。
注意这个定义里有两个关键词:
- “表现出”:不要求机器真的"理解"或"有意识",只要行为上看起来聪明就行
- “类似人类的”:参照物是人类智能,比如看、听、说、推理、决策
这意味着:不管你用什么手段实现,只要机器的行为看起来"聪明",都算AI。
2. AI的实现方式不止一种
很多人以为AI=机器学习=深度学习,其实不是。实现AI至少有三条路线:
| 路线 | 核心思想 | 大白话 | 代表应用 |
|---|---|---|---|
| 规则驱动(符号主义) | 人类把规则写好,机器照着执行 | 你写菜谱,机器人照着炒 | 早期专家系统、棋类AI(深蓝) |
| 学习驱动(连接主义) | 给机器数据,让它自己学规律 | 给机器人试吃一万道菜,它自己悟出怎么炒 | 机器学习、深度学习 |
| 进化驱动(进化计算) | 模拟自然选择,让方案"适者生存" | 让一群机器人炒菜,炒得好的留下,差的淘汰 | 遗传算法、部分优化问题 |
今天最火的是第二条路(学习驱动),但第一条路(规则驱动)并没有消失——很多企业系统里的规则引擎、风控策略,本质上还是"规则驱动的AI"。
重点:AI是目标,不是方法。机器学习只是实现AI的方法之一,虽然目前是最成功的一种。
3. 强AI vs 弱AI
讲AI绕不开这两个概念:
- 弱AI(窄AI):在特定领域表现得像人一样聪明,但出了这个领域就不行了。比如AlphaGo下棋无敌,但你让它写个邮件它不会。今天所有的AI都是弱AI。
- 强AI(通用AI/AGI):跟人一样,什么都能学、什么都能干。ChatGPT看起来好像什么都能聊,但它本质上还是弱AI——它只是在语言这个领域表现得很好而已。AGI目前还不存在,什么时候能实现,没人知道。
| 弱AI | 强AI(AGI) | |
|---|---|---|
| 能力范围 | 单一领域 | 跨领域通用 |
| 是否存在 | 已存在,到处都是 | 还没有,只是目标 |
| 例子 | 人脸识别、翻译、ChatGPT | 科幻电影里的那种AI |
| 大白话 | 偏科天才 | 全能超人 |
你平时接触到的所有AI应用,全部是弱AI。包括ChatGPT。
三、ML(机器学习):AI里面最成功的方法
1. 机器学习到底在干什么
上一章我们说过,专家系统靠人写规则,写不过来。机器学习换了个思路:
不写规则,给数据,让机器自己找规律。
更正式的定义是:
机器学习是让计算机从数据中自动学习规律,并用学到的规律来做预测或决策,而不需要人显式地编写规则。
三个要素缺一不可:
| 要素 | 作用 | 大白话 |
|---|---|---|
| 数据 | 学习的原材料 | 没有食材怎么做菜 |
| 算法 | 学习的方法 | 是清蒸还是红烧 |
| 模型 | 学到的规律本身 | 做出来的那道菜 |
2. 机器学习的三大类
机器学习按"怎么学"分三大类:
(1)监督学习——有标准答案的学习
你给机器一批数据,每条数据都标好了正确答案,机器通过反复对照学会规律。
例子:给机器看1万张猫和狗的照片,每张都标了"这是猫"或"这是狗"。机器看完后,你拿一张新照片问它,它能判断是猫还是狗。
大白话:做有答案的练习册,做完对照答案,下次考试就会了。
常见任务:
- 分类:垃圾邮件检测(垃圾/正常)、疾病诊断(有病/没病)
- 回归:房价预测(预测一个具体的数字)
常见算法:线性回归、逻辑回归、决策树、随机森林、SVM、KNN
(2)无监督学习——没有标准答案的学习
你给机器一批数据,不标答案,让机器自己找规律、自己分组。
例子:你有一堆用户消费数据,不告诉机器该怎么分,机器自己发现"这批人喜欢买电子产品,那批人喜欢买衣服"——自动用户分群。
大白话:发了一堆混在一起的扑克牌,没人告诉你怎么分,你自己按花色或数字整理好了。
常见任务:
- 聚类:用户分群、异常检测
- 降维:把高维数据压缩到低维,方便可视化
常见算法:K-Means、DBSCAN、PCA、层次聚类
(3)强化学习——靠"奖惩"学习
机器在环境中不断试错行动,做对了给奖励、做错了给惩罚,通过不断调整策略来最大化长期收益。
例子:训练AI玩超级玛丽。它一开始乱跳乱走,掉坑里扣分,吃到金币加分。经过几百万次尝试,它学会了最优路线。
大白话:训练小狗——做对了给零食,做错了呵斥,慢慢就训出来了。
常见应用:AlphaGo、自动驾驶决策、游戏AI、机器人控制
常见算法:Q-Learning、DQN、PPO
3. 机器学习 ≠ 深度学习
很多人把"机器学习"和"深度学习"画等号,这是不对的。
机器学习是一个大类,里面有很多种方法:
| 方法 | 特点 | 大白话 |
|---|---|---|
| 决策树 | 像画流程图一样做决策 | 二十问游戏——“是动物吗?”“会飞吗?” |
| 随机森林 | 很多棵决策树投票 | 一个人拿不准,找100个人投票 |
| SVM | 找一条最优分界线 | 在两组点中间画一条线,让两边离得最远 |
| KNN | 看邻居是什么就判断成什么 | 近朱者赤近墨者黑 |
| 朴素贝叶斯 | 基于概率分类 | 根据以往经验算概率 |
| 神经网络/深度学习 | 多层神经网络,能学复杂规律 | 上面这些的"加强版",能处理更难的问题 |
深度学习只是机器学习这个工具箱里的一把工具。只不过这把工具最近几年太猛了,把其他工具的风头全抢了。 但这不代表其他工具没用——很多时候,决策树比神经网络更好用、更快、更便宜、更好解释。
一个重要的实践认知:不是所有问题都需要深度学习。 很多企业级场景,用随机森林或XGBoost就够了,效果好、速度快、可解释性强。上来就深度学习,大概率是过度设计。
四、DL(深度学习):机器学习里的"大杀器"
1. 深度学习到底"深"在哪
深度学习用的也是神经网络,但跟传统神经网络比,它"深"——层数多。
神经网络的基本结构是这样的:
输入层 → 隐藏层 → 隐藏层 → ... → 隐藏层 → 输出层
- 浅层神经网络:只有1-2个隐藏层
- 深度神经网络:有很多层(几十层甚至上百层)
"深"就是指层数多。
为什么层数多了就厉害?因为每一层可以学到不同层次的特征:
以识别一张人脸为例:
| 层级 | 学到的东西 | 大白话 |
|---|---|---|
| 第1层 | 边缘、线条 | “这里有条线” |
| 第2层 | 简单形状 | “这个形状像眼睛” |
| 第3层 | 局部特征 | “这是一双眼睛” |
| 第4层 | 整体特征 | “这是一张人脸” |
| 更深层 | 抽象概念 | “这是张三的脸” |
层数越多,能学到的特征越抽象、越高级。 这就是为什么深度学习能处理极其复杂的任务。
2. 深度学习的几大主力架构
深度学习不是只有一种网络,不同的任务用不同的架构:
| 架构 | 擅长什么 | 代表应用 | 大白话 |
|---|---|---|---|
| CNN(卷积神经网络) | 看图 | 人脸识别、医学影像、自动驾驶视觉 | 给机器装"眼睛" |
| RNN/LSTM(循环神经网络) | 处理序列 | 语音识别、机器翻译、文本生成(早期) | 给机器装"记忆" |
| Transformer | 理解语言、生成内容 | GPT、BERT、所有大模型 | 给机器装"全局视野" |
| GAN(生成对抗网络) | 生成逼真内容 | AI换脸、AI绘画(早期) | 两个AI打架,一个造假一个打假 |
| Diffusion(扩散模型) | 生成图片 | Stable Diffusion、Midjourney | 从噪声中慢慢"雕刻"出图片 |
注意:Transformer已经基本取代了RNN/LSTM在NLP领域的地位。 今天你用的大模型,底层全是Transformer,没有例外。
3. 深度学习的代价
深度学习效果虽好,但不是没代价的:
| 维度 | 深度学习 | 传统机器学习 | 大白话 |
|---|---|---|---|
| 数据需求 | 大(万条起步) | 小(几百条就行) | 深度学习是"大胃王",吃不饱就不干活 |
| 算力需求 | 高(需要GPU) | 低(CPU就行) | 深度学习要开跑车,传统ML骑自行车也行 |
| 可解释性 | 差(黑盒) | 好(能看到决策过程) | 深度学习是"我也不知道为什么,但结果就是这样" |
| 开发难度 | 高 | 低 | 深度学习要调的参数多得吓人 |
| 适合场景 | 复杂任务(图像、语言) | 结构化数据(表格、数字) | 别用牛刀杀鸡 |
一个关键判断标准: 你的数据是表格/数字型(比如用户特征、交易记录),优先考虑传统ML;你的数据是图像/文本/语音,那大概率需要深度学习。
五、今天的大模型属于哪一层?
这是很多人会问的问题:ChatGPT算AI、ML还是DL?
答案:三个都算,但最准确的描述是"基于深度学习的自然语言处理模型"。
层次关系是这样的:
AI(人工智能)
└─ ML(机器学习)
└─ DL(深度学习)
└─ Transformer架构
└─ 大语言模型(LLM)
└─ GPT / Claude / LLaMA / Qwen ...
每一层都是上一层的一个子集。大模型是深度学习的一个具体应用,深度学习是机器学习的一个子集,机器学习是实现AI的一种方法。
所以下次有人说"ChatGPT是AI",没错但不够精确。就像说"法拉利是交通工具"——对是对,但信息量不够。
六、一张表搞清楚三个概念
| AI(人工智能) | ML(机器学习) | DL(深度学习) | |
|---|---|---|---|
| 是什么 | 一个目标 | 一种方法 | 一种具体技术 |
| 范围 | 最大 | AI的子集 | ML的子集 |
| 核心思想 | 让机器表现得聪明 | 从数据中学规律 | 用多层神经网学复杂规律 |
| 出现时间 | 1956年 | 1950s末-1960s | 2006年概念提出,2012年爆发 |
| 数据需求 | 不一定需要数据 | 需要数据 | 需要大量数据 |
| 算力需求 | 不一定 | 中等 | 高 |
| 典型应用 | 一切智能系统 | 推荐系统、风控、预测 | 人脸识别、语音识别、大模型 |
| 比方 | 做饭 | 炒菜 | 铁锅猛火炒 |
| 一句话 | 目标 | 手段 | 终极武器 |
七、对开发者的实际意义
讲这么多概念不是为了考试,是为了你在实际开发中做对决策:
场景1:你要做"垃圾邮件过滤"
- 选AI(规则):写关键词规则——“包含’中奖’的标为垃圾”。简单,但容易被绕过
- 选ML(传统):用朴素贝叶斯——效果好、速度快、可解释。推荐这个
- 选DL:杀鸡用牛刀,没必要
场景2:你要做"用户流失预测"
- 选ML(传统):用随机森林或XGBoost——表格数据的天花板方案。推荐这个
- 选DL:表格数据上深度学习优势不明显,还更难调
场景3:你要做"智能客服问答"
- 选规则:写不过来,维护噩梦
- 选ML(传统):可以做意图分类,但没法生成自然语言回复
- 选DL(大模型+RAG):这才是当前最优解。推荐这个
场景4:你要做"医学影像诊断"
- 选ML(传统):效果不够,图像太复杂
- 选DL(CNN):图像识别是CNN的主场。推荐这个
总结一句话:根据任务类型和数据类型选技术,别上来就深度学习,也别看不起传统ML。
本章小结
| 要点 | 内容 |
|---|---|
| 三个概念的关系 | AI > ML > DL,俄罗斯套娃式包含 |
| AI是什么 | 一个目标——让机器表现得聪明 |
| ML是什么 | 一种方法——让机器从数据中学规律 |
| DL是什么 | 一种技术——用多层神经网络学复杂规律 |
| 三者的关系 | DL是ML的子集,ML是实现AI的方法之一 |
| 大模型属于哪层 | 基于DL的Transformer架构 → LLM → GPT等 |
| 实践建议 | 按场景选技术,表格数据用传统ML,图像文本用DL,不是越"深"越好 |
下一章预告: 第3章「AI的能力边界」—— AI到底能干什么、不能干什么?哪些活AI干得好、哪些活它根本干不了?搞清楚边界,才能避免"拿着锤子看什么都是钉子"的陷阱。
更多推荐

所有评论(0)