108张图搞懂AI基础|Token·LLM·深度学习一次讲透(零基础入门)
108张图搞懂AI基础|Token·LLM·深度学习一次讲透(零基础入门)
本文是「108张AI知识卡片·大模型通关手册」系列的开篇。零基础学AI,从哪里开始?不用写代码、不用啃论文,这一篇用 8 张图帮你建立 AI 的核心知识坐标系——从 Token 到强化学习,一条线串起来。系列共 108 张卡片、22 篇笔记,覆盖大模型开发者必经的全链路。
- Token:AI 处理文字的最小单位,不是"字"也不是"词",更像"积木块"。
- Prompt:你给 AI 的输入指令,问得好答得才妙。
- LLM:大语言模型,ChatGPT 这类产品背后的"大脑"。
- 深度学习:基于神经网络的范式,越练越强。
- 机器学习:更上位的统称,让机器从数据中找规律。
- 有监督 / 无监督:按"有没有标注答案"区分的两种学习方式。
- 强化学习:靠"奖惩反馈"试错学习,AlphaGo 就靠它。
读完这 8 个概念,你就有了一张 AI 入门的"全景地图",后续看任何技术文章都不会迷路。
一、Token:AI 理解文字的最小单位
通俗类比:像乐高的积木块。AI 看不懂"汉字"也看不懂"英文单词",它只认一串串数字。把句子切成一小块一小块(Token),每块对应一个编号,AI 才能开始处理。
几个关键认知:
- Token ≠ 字、≠ 词:中文里"知识"可能被切成"知"+"识"两个 Token,英文里 “understanding” 可能是 1 个或多个 Token,取决于分词器。
- 计费单位:几乎所有大模型 API 按 Token 计费,输入 Token 和输出 Token 单价不同。
- 上下文窗口:模型一次能"看进来"的字数上限,单位也是 Token(如 128K、200K)。

💡 经验:中文平均 1 字 ≈ 1.5–2 Token,英文平均 1 词 ≈ 1–2 Token。粗估灵感来源,实际以分词器为准。
二、Prompt:跟 AI 说话的方式

通俗类比:Prompt 是你和 AI 对话时的"提问方式"。同样问"今天天气怎样",问得越具体,AI 答得越靠谱。
为什么 Prompt 重要:模型本身是固定的,真正决定输出质量的,是你怎么"喂"问题。这也是为什么会有"Prompt 工程"这个专门方向——后续系列会单独开篇讲。
新手最常踩的 3 个坑:
- 太笼统:“帮我写个方案” → AI 只能瞎猜你要什么。
- 不给背景:不给角色、不给受众、不给格式要求。
- 一次问太多:把 5 个问题塞进一句,模型容易漏答。
后续系列(Prompt 篇)会系统讲:零样本、少样本、思维链 CoT、Context 上下文等。
三、LLM:大语言模型,ChatGPT 的"超级大脑"

通俗类比:LLM(Large Language Model)= 读过整个互联网的"超级大脑",你给它一段开头,它能接下去续写。
它实际在做什么:本质是在做**“下一个 Token 预测”**。给它前面一段文字,它计算每个候选 Token 出现的概率,挑一个接上,再重复这个过程。一次接一个 Token,直到结束。
关键的"大"在哪:
- 参数量大:从几亿到几千亿。
- 训练数据大:海量互联网文本。
- 算力大:训练一次动辄几千张 GPU。
下一篇我们会聊到"参数规模 × 涌现行为"——为什么模型越大越聪明,以及预训练 / SFT / RLHF 这套"调教流水线"是怎么把一个"只会续写"的模型变成"会对话"的助手的。
四、深度学习:AI 的"直觉系统"

通俗类比:模拟人脑神经元的"多层网络",信息和权重在层与层之间传递,越练识别越准,像练就了"直觉"。
和"机器学习"的关系:深度学习是机器学习的一个分支,特指用多层神经网络的那一支。LLM、图像识别、语音识别,背后基本都是深度学习。
为什么"深":
- 浅层网络学表层特征(边缘、颜色)。
- 深层网络能把低层特征组合成高层概念(从"线条"到"轮廓"到"猫脸")。
五、机器学习:AI 的"学习方式"

通俗类比:不靠人写规则,而是让机器从数据中自己找规律。给它一堆"猫"的照片,它自己总结出"什么样的特征是猫"。
和传统编程的区别:
| 传统编程 | 机器学习 | |
|---|---|---|
| 输入 | 数据 + 规则 | 数据 + 答案 |
| 输出 | 结果 | 规则(模型) |
| 本质 | 人写逻辑 | 机器学逻辑 |
深度学习 ⊂ 机器学习 ⊂ AI。三者是包含关系,别搞混。
六、有监督学习:老师带学,答案标注好

通俗类比:像老师带学生做练习册——每道题都附标准答案,做错了老师纠正。机器通过"对照答案"调整自己的判断规则。
核心特征:数据有标注(label)。
典型场景:
- 图像分类(这张图是猫还是狗?→ 标注好的图库)
- 垃圾邮件识别(这封是垃圾吗?→ 人工标注)
- 房价预测(特征+真实成交价)
七、无监督学习:自己摸索,从混乱中发现结构

通俗类比:给孩子一堆混在一起的积木,没人教,他自己按颜色、形状分出几堆——这就是无监督学习,从无标注数据中发现结构。
核心特征:数据无标注。
典型场景:
- 用户聚类(把行为相似的用户分群)
- 异常检测(找出"与众不同的那一个")
- 降维(把高维数据压到能可视化的低维)
八、强化学习:奖惩驱动,做对了给糖吃

通俗类比:训小狗——做对了给零食,做错了没奖励。小狗为了拿更多零食,会越来越"懂规矩"。强化学习靠奖励信号驱动智能体在环境里试错。
三个核心角色:
- 智能体(Agent):做决策的主体。
- 环境(Environment):智能体交互的世界。
- 奖励(Reward):每步动作后的反馈。
大名鼎鼎的代表:AlphaGo、ChatGPT 背后的 RLHF(人类反馈强化学习)都用到了它。可以说没有强化学习,就没有现在"会对话、懂礼貌"的 ChatGPT。
九、一张图串起 AI 知识体系
8 个概念不是散落的,它们有清晰的层级关系:
AI(人工智能)
│
机器学习(从数据找规律)
┌────────┼─────────┐
有监督学习 无监督学习 强化学习
│
深度学习(多层神经网络)
│
LLM(大语言模型)
┌──┴──┐
Token Prompt
记忆口诀:
- 机器学习是"方法大类",深度学习是"用神经网络的方法",LLM 是"用深度学习做的语言大模型"。
- Token 是 LLM 的输入单位,Prompt 是你写给 LLM 的输入内容。
- 有监督 / 无监督 / 强化 是机器学习的三种主要学习范式。
十、可动手体验:用 3 行代码摸到 Token
光看概念不过瘾?用 OpenAI 兼容接口的分词器,3 行代码感受下 Token 到底是怎么切的(绝大多数国产模型 API 也提供类似接口):
from tiktoken import get_encoding
enc = get_encoding("cl100k_base") # GPT-4 系列常用分词器
text = "大模型入门从Token开始"
tokens = enc.encode(text)
print(f"原文:{text}")
print(f"Token 数:{len(tokens)}")
print(f"Token 序列:{tokens}")
# 输出示例:Token 数大概是 8-10 个,中文每个字通常占 1-2 个 Token
想看可视化效果,可以去 OpenAI 官方的 Tokenizer 页面,粘贴任意文字,会高亮显示每个 Token 的切分边界——这是我见过最快的"理解 Token"的方式。
系列导航 & 持续更新
这是 「108张AI知识卡片·大模型通关手册」 系列的开篇。整套系列共 108 张卡片、22 篇笔记,覆盖 AI 基础、Prompt 工程、RAG、Agent、模型微调部署、评测、安全、工程化等大模型开发者必经的全链路。建议先关注收藏,跟着系列一篇篇走完,你会拥有一张完整的"大模型知识地图"。
📚 下一篇预告:大模型为什么越大越聪明?参数规模 × 涌现行为 + 预训练 / SFT / RLHF 调教流水线全解析
如果这篇对你有帮助,点个👍收藏,建立起 AI 基础坐标系后,后续看任何技术文章都不会迷路。有问题欢迎在评论区交流,我会逐条回复。
更多推荐


所有评论(0)