一句话点题: 这三个词不是并列的,是"俄罗斯套娃"——一层包一层。AI最大,机器学习是AI里面的一种方法,深度学习是机器学习里面的一种方法。


写在前面

你可能经常看到这样的说法:

  • “AI将取代人类工作”
  • “机器学习正在改变金融行业”
  • “深度学习实现了人脸识别”

这三个词经常被混着用,好像说的是同一件事。媒体这么干也就算了,但如果你自己搞开发也分不清,那选技术方案的时候就会犯迷糊:我到底需要AI?机器学习?还是深度学习?

这章的目标就一个:让你看完之后再也不会把这三个词搞混。


一、先看全景:三个圈的关系

用一张图就能说清楚:

┌─────────────────────────────────────────┐
│              人工智能 (AI)                │
│                                         │
│   ┌───────────────────────────────┐     │
│   │       机器学习 (ML)            │     │
│   │                               │     │
│   │   ┌───────────────────────┐   │     │
│   │   │   深度学习 (DL)        │   │     │
│   │   │                       │   │     │
│   │   └───────────────────────┘   │     │
│   │                               │     │
│   │   (ML里还有其他方法)          │     │
│   └───────────────────────┬───────┘     │
│                           │             │
│   (AI里还有其他方法)       │             │
│                           │             │
└───────────────────────────┴─────────────┘

三个圈,从外到内:

  • AI(人工智能):最大的圈,指的是"让机器表现得像人一样聪明"这个总目标
  • ML(机器学习):AI里面的一个子集,是实现AI的一种方法
  • DL(深度学习):ML里面的一个子集,是机器学习的一种具体技术

打个生活中的比方:

概念 对应的比方 大白话
AI “做饭” 一个大目标,就是做出好吃的饭
ML “炒菜” 做饭的一种方式,不是唯一方式(你也可以蒸、煮、烤)
DL “铁锅猛火炒” 炒菜的一种具体手法,效果猛但门槛高

你说"我在做饭",别人不知道你是炒是蒸还是煮。你说"我在炒菜",范围缩小了。你说"我用铁锅猛火炒",非常具体。

同理:

  • 你说"我在做AI",可能是在写if-else规则,也可能在训练大模型
  • 你说"我在做机器学习",说明你是让机器从数据里学,但用的可能决策树也可能神经网络
  • 你说"我在做深度学习",非常明确,你在用多层神经网络

二、AI(人工智能):最大的那个圈

1. AI到底是什么

AI不是一个具体的技术,而是一个目标——让机器表现出类似人类的智能行为。

注意这个定义里有两个关键词:

  • “表现出”:不要求机器真的"理解"或"有意识",只要行为上看起来聪明就行
  • “类似人类的”:参照物是人类智能,比如看、听、说、推理、决策

这意味着:不管你用什么手段实现,只要机器的行为看起来"聪明",都算AI。

2. AI的实现方式不止一种

很多人以为AI=机器学习=深度学习,其实不是。实现AI至少有三条路线:

路线 核心思想 大白话 代表应用
规则驱动(符号主义) 人类把规则写好,机器照着执行 你写菜谱,机器人照着炒 早期专家系统、棋类AI(深蓝)
学习驱动(连接主义) 给机器数据,让它自己学规律 给机器人试吃一万道菜,它自己悟出怎么炒 机器学习、深度学习
进化驱动(进化计算) 模拟自然选择,让方案"适者生存" 让一群机器人炒菜,炒得好的留下,差的淘汰 遗传算法、部分优化问题

今天最火的是第二条路(学习驱动),但第一条路(规则驱动)并没有消失——很多企业系统里的规则引擎、风控策略,本质上还是"规则驱动的AI"。

重点:AI是目标,不是方法。机器学习只是实现AI的方法之一,虽然目前是最成功的一种。

3. 强AI vs 弱AI

讲AI绕不开这两个概念:

  • 弱AI(窄AI):在特定领域表现得像人一样聪明,但出了这个领域就不行了。比如AlphaGo下棋无敌,但你让它写个邮件它不会。今天所有的AI都是弱AI。
  • 强AI(通用AI/AGI):跟人一样,什么都能学、什么都能干。ChatGPT看起来好像什么都能聊,但它本质上还是弱AI——它只是在语言这个领域表现得很好而已。AGI目前还不存在,什么时候能实现,没人知道。
弱AI 强AI(AGI)
能力范围 单一领域 跨领域通用
是否存在 已存在,到处都是 还没有,只是目标
例子 人脸识别、翻译、ChatGPT 科幻电影里的那种AI
大白话 偏科天才 全能超人

你平时接触到的所有AI应用,全部是弱AI。包括ChatGPT。


三、ML(机器学习):AI里面最成功的方法

1. 机器学习到底在干什么

上一章我们说过,专家系统靠人写规则,写不过来。机器学习换了个思路:

不写规则,给数据,让机器自己找规律。

更正式的定义是:

机器学习是让计算机从数据中自动学习规律,并用学到的规律来做预测或决策,而不需要人显式地编写规则。

三个要素缺一不可:

要素 作用 大白话
数据 学习的原材料 没有食材怎么做菜
算法 学习的方法 是清蒸还是红烧
模型 学到的规律本身 做出来的那道菜

2. 机器学习的三大类

机器学习按"怎么学"分三大类:

(1)监督学习——有标准答案的学习

你给机器一批数据,每条数据都标好了正确答案,机器通过反复对照学会规律。

例子:给机器看1万张猫和狗的照片,每张都标了"这是猫"或"这是狗"。机器看完后,你拿一张新照片问它,它能判断是猫还是狗。

大白话:做有答案的练习册,做完对照答案,下次考试就会了。

常见任务:

  • 分类:垃圾邮件检测(垃圾/正常)、疾病诊断(有病/没病)
  • 回归:房价预测(预测一个具体的数字)

常见算法:线性回归、逻辑回归、决策树、随机森林、SVM、KNN

(2)无监督学习——没有标准答案的学习

你给机器一批数据,不标答案,让机器自己找规律、自己分组。

例子:你有一堆用户消费数据,不告诉机器该怎么分,机器自己发现"这批人喜欢买电子产品,那批人喜欢买衣服"——自动用户分群。

大白话:发了一堆混在一起的扑克牌,没人告诉你怎么分,你自己按花色或数字整理好了。

常见任务:

  • 聚类:用户分群、异常检测
  • 降维:把高维数据压缩到低维,方便可视化

常见算法:K-Means、DBSCAN、PCA、层次聚类

(3)强化学习——靠"奖惩"学习

机器在环境中不断试错行动,做对了给奖励、做错了给惩罚,通过不断调整策略来最大化长期收益

例子:训练AI玩超级玛丽。它一开始乱跳乱走,掉坑里扣分,吃到金币加分。经过几百万次尝试,它学会了最优路线。

大白话:训练小狗——做对了给零食,做错了呵斥,慢慢就训出来了。

常见应用:AlphaGo、自动驾驶决策、游戏AI、机器人控制

常见算法:Q-Learning、DQN、PPO

3. 机器学习 ≠ 深度学习

很多人把"机器学习"和"深度学习"画等号,这是不对的。

机器学习是一个大类,里面有很多种方法:

方法 特点 大白话
决策树 像画流程图一样做决策 二十问游戏——“是动物吗?”“会飞吗?”
随机森林 很多棵决策树投票 一个人拿不准,找100个人投票
SVM 找一条最优分界线 在两组点中间画一条线,让两边离得最远
KNN 看邻居是什么就判断成什么 近朱者赤近墨者黑
朴素贝叶斯 基于概率分类 根据以往经验算概率
神经网络/深度学习 多层神经网络,能学复杂规律 上面这些的"加强版",能处理更难的问题

深度学习只是机器学习这个工具箱里的一把工具。只不过这把工具最近几年太猛了,把其他工具的风头全抢了。 但这不代表其他工具没用——很多时候,决策树比神经网络更好用、更快、更便宜、更好解释。

一个重要的实践认知:不是所有问题都需要深度学习。 很多企业级场景,用随机森林或XGBoost就够了,效果好、速度快、可解释性强。上来就深度学习,大概率是过度设计。


四、DL(深度学习):机器学习里的"大杀器"

1. 深度学习到底"深"在哪

深度学习用的也是神经网络,但跟传统神经网络比,它"深"——层数多。

神经网络的基本结构是这样的:

输入层 → 隐藏层 → 隐藏层 → ... → 隐藏层 → 输出层
  • 浅层神经网络:只有1-2个隐藏层
  • 深度神经网络:有很多层(几十层甚至上百层)

"深"就是指层数多

为什么层数多了就厉害?因为每一层可以学到不同层次的特征:

以识别一张人脸为例:

层级 学到的东西 大白话
第1层 边缘、线条 “这里有条线”
第2层 简单形状 “这个形状像眼睛”
第3层 局部特征 “这是一双眼睛”
第4层 整体特征 “这是一张人脸”
更深层 抽象概念 “这是张三的脸”

层数越多,能学到的特征越抽象、越高级。 这就是为什么深度学习能处理极其复杂的任务。

2. 深度学习的几大主力架构

深度学习不是只有一种网络,不同的任务用不同的架构:

架构 擅长什么 代表应用 大白话
CNN(卷积神经网络) 看图 人脸识别、医学影像、自动驾驶视觉 给机器装"眼睛"
RNN/LSTM(循环神经网络) 处理序列 语音识别、机器翻译、文本生成(早期) 给机器装"记忆"
Transformer 理解语言、生成内容 GPT、BERT、所有大模型 给机器装"全局视野"
GAN(生成对抗网络) 生成逼真内容 AI换脸、AI绘画(早期) 两个AI打架,一个造假一个打假
Diffusion(扩散模型) 生成图片 Stable Diffusion、Midjourney 从噪声中慢慢"雕刻"出图片

注意:Transformer已经基本取代了RNN/LSTM在NLP领域的地位。 今天你用的大模型,底层全是Transformer,没有例外。

3. 深度学习的代价

深度学习效果虽好,但不是没代价的:

维度 深度学习 传统机器学习 大白话
数据需求 大(万条起步) 小(几百条就行) 深度学习是"大胃王",吃不饱就不干活
算力需求 高(需要GPU) 低(CPU就行) 深度学习要开跑车,传统ML骑自行车也行
可解释性 差(黑盒) 好(能看到决策过程) 深度学习是"我也不知道为什么,但结果就是这样"
开发难度 深度学习要调的参数多得吓人
适合场景 复杂任务(图像、语言) 结构化数据(表格、数字) 别用牛刀杀鸡

一个关键判断标准: 你的数据是表格/数字型(比如用户特征、交易记录),优先考虑传统ML;你的数据是图像/文本/语音,那大概率需要深度学习。


五、今天的大模型属于哪一层?

这是很多人会问的问题:ChatGPT算AI、ML还是DL?

答案:三个都算,但最准确的描述是"基于深度学习的自然语言处理模型"。

层次关系是这样的:

AI(人工智能)
  └─ ML(机器学习)
       └─ DL(深度学习)
            └─ Transformer架构
                 └─ 大语言模型(LLM)
                      └─ GPT / Claude / LLaMA / Qwen ...

每一层都是上一层的一个子集。大模型是深度学习的一个具体应用,深度学习是机器学习的一个子集,机器学习是实现AI的一种方法。

所以下次有人说"ChatGPT是AI",没错但不够精确。就像说"法拉利是交通工具"——对是对,但信息量不够。


六、一张表搞清楚三个概念

AI(人工智能) ML(机器学习) DL(深度学习)
是什么 一个目标 一种方法 一种具体技术
范围 最大 AI的子集 ML的子集
核心思想 让机器表现得聪明 从数据中学规律 用多层神经网学复杂规律
出现时间 1956年 1950s末-1960s 2006年概念提出,2012年爆发
数据需求 不一定需要数据 需要数据 需要大量数据
算力需求 不一定 中等
典型应用 一切智能系统 推荐系统、风控、预测 人脸识别、语音识别、大模型
比方 做饭 炒菜 铁锅猛火炒
一句话 目标 手段 终极武器

七、对开发者的实际意义

讲这么多概念不是为了考试,是为了你在实际开发中做对决策:

场景1:你要做"垃圾邮件过滤"

  • 选AI(规则):写关键词规则——“包含’中奖’的标为垃圾”。简单,但容易被绕过
  • 选ML(传统):用朴素贝叶斯——效果好、速度快、可解释。推荐这个
  • 选DL:杀鸡用牛刀,没必要

场景2:你要做"用户流失预测"

  • 选ML(传统):用随机森林或XGBoost——表格数据的天花板方案。推荐这个
  • 选DL:表格数据上深度学习优势不明显,还更难调

场景3:你要做"智能客服问答"

  • 选规则:写不过来,维护噩梦
  • 选ML(传统):可以做意图分类,但没法生成自然语言回复
  • 选DL(大模型+RAG):这才是当前最优解。推荐这个

场景4:你要做"医学影像诊断"

  • 选ML(传统):效果不够,图像太复杂
  • 选DL(CNN):图像识别是CNN的主场。推荐这个

总结一句话:根据任务类型和数据类型选技术,别上来就深度学习,也别看不起传统ML。


本章小结

要点 内容
三个概念的关系 AI > ML > DL,俄罗斯套娃式包含
AI是什么 一个目标——让机器表现得聪明
ML是什么 一种方法——让机器从数据中学规律
DL是什么 一种技术——用多层神经网络学复杂规律
三者的关系 DL是ML的子集,ML是实现AI的方法之一
大模型属于哪层 基于DL的Transformer架构 → LLM → GPT等
实践建议 按场景选技术,表格数据用传统ML,图像文本用DL,不是越"深"越好

下一章预告: 第3章「AI的能力边界」—— AI到底能干什么、不能干什么?哪些活AI干得好、哪些活它根本干不了?搞清楚边界,才能避免"拿着锤子看什么都是钉子"的陷阱。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐