大模型为什么越大越聪明?参数规模×涌现行为+预训练三阶段全讲透
📢 本文是 「108张AI知识卡片·大模型通关手册」 系列第 2 篇。GPT-4 凭什么比 GPT-3 聪明?模型变大到底多了什么?这篇用 5 张图把"参数规模""涌现行为"和"预训练→SFT→RLHF"三阶段讲清楚——从量变到质变,一条线理清大模型的成长之路。
目录
- TL;DR 太长不看
- 一、参数规模:大脑的"神经突触"
- 二、涌现行为:水到 100 度突然沸腾
- 三、预训练:海量通识打底子
- 四、SFT 监督微调:跟着导师学方法
- 五、RLHF 对齐偏好:入职培训学规矩
- 六、三阶段怎么串成一条线
- 七、可动手:感受参数规模与涌现
- 写到最后:这个系列打算怎么更
- 系列导航 & 持续更新
TL;DR 太长不看
⚡ 30 秒版:怕太长?先记这 5 条,建立框架,细节往下翻。
- 📐 参数规模:参数像大脑的神经突触,7B→175B,参数越多能记住的模式越复杂。
- ✨ 涌现行为:模型大到一定程度"突然开窍",能做没训练过的事——量变引发质变。
- 1️⃣ 预训练:海量阅读,打知识底子(像大学通识)。
- 2️⃣ SFT:精选范例教学(像研究生跟导师学方法)。
- 3️⃣ RLHF:学会"说人话"、对齐人类偏好(像入职培训学规矩)。
一句话:参数大了才会涌现,三阶段调教才让它会对话。
一、参数规模:大脑的"神经突触"

通俗类比:模型参数就像大脑的"神经突触"——突触越多,能记住和组合的模式越复杂。一个读过 1000 本书的人,和一个只读过 10 本的,见识和反应速度自然不一样。
几个关键认知:
- 7B / 13B / 175B 是什么:B = Billion(十亿),175B 就是 1750 亿参数。GPT-3 是 175B,GPT-4 据传是混合专家模型,参数量更大。
- 参数≠越大越好:参数大需要更多算力、更贵的训练成本,也会过拟合;关键是匹配你的任务和数据量。
- 开源生态的分层:小模型(7B 级)能本地跑、适合微调;大模型(几百 B)靠 API 调用。
二、涌现行为:水到 100 度突然沸腾

通俗类比:水从 1℃ 到 99℃ 都是水,到 100℃ 突然沸腾变蒸汽——模型也一样,小时候只会"照猫画虎",大到某个临界点"突然开窍",能做没训练过的事(比如没专门教数学,却会做推理)。
为什么神奇:
- 研究发现某些能力(少样本学习、推理、代码)不是平稳增长,而是阶段式跳变——参数量过某条线后才"冒出来"。
- 这也是为什么小模型有时候"教不会"某项能力,不是数据不够,是没到涌现的规模。
⚠️ 注意:涌现是经验观察现象,学界对"是不是真的相变"还有争论,但工程上"大模型能力跳变"是实打实存在的。
三、预训练:海量通识打底子

通俗类比:大学四年通识教育——海量阅读、什么都看点,构建知识底子。这一阶段模型学的是**“下一个 Token 预测”**,从海量文本里自己悟语言规律和世界知识。
关键点:
- 数据量巨大:通常用互联网级的文本(几 TB 甚至几十 TB),动辄几千张 GPU 跑几个月。
- 产物是"基座模型":预训练完的模型只会"续写"——你给它"床前明月光",它接"疑是地上霜",但还不会对话。
- 成本最高:这一步是大模型成本的大头,所以基座模型是少数玩家的游戏。
四、SFT 监督微调:跟着导师学方法

通俗类比:研究生阶段跟着导师学方法——不再海量乱读,而是精选高质量范例,按"问题→答案"的对子来教,让模型学会"按指令做事"。
和预训练的区别:
- 预训练:无监督,吃海量原始文本。
- SFT:有监督,吃人工标注的"指令-回答"对,数据量小但质量极高。
- 效果:SFT 后,模型从"只会续写"变成"会回答问题、会照指令输出"。
五、RLHF 对齐偏好:入职培训学规矩

通俗类比:入职培训学职场规矩——技术上你已经会干活了,但还得学会说人话、懂礼貌、不乱说。RLHF(基于人类反馈的强化学习)就是这步。
怎么做的:
- 让模型对同一个问题生成多个回答,人类标注员按"哪个更好"打分。
- 用这些偏好训练一个奖励模型,再用强化学习让主模型往高分方向优化。
- 效果:输出更符合人类偏好——更有用、更无害、更诚实。这是 ChatGPT 能"礼貌又靠谱"的关键。
六、三阶段怎么串成一条线
预训练 SFT RLHF
海量通识 → 精范例教学 → 对齐偏好
(打知识底子) (学会照指令做) (学会说人话)
│ │ │
基座模型 能对话的模型 礼貌靠谱的助手
记忆口诀:
- 预训练喂的是"书",SFT喂的是"范例",RLHF喂的是"反馈"。
- 基座→会干活→会说话,三步把一个"只会续写"的模型调教成"懂礼貌的助手"。
- 没有预训练没知识,没有 SFT 没能力,没有 RLHF 没规矩——三阶段缺一不可。
🔗 这 5 张卡串着玩:参数规模→涌现→预训练→SFT→RLHF,建议按顺序点一遍,你会把"大模型成长路"一次理清。
七、可动手:感受参数规模与涌现
光说不练假把式,这里给个能直接感受"模型规模差异"的玩法:同一段 Prompt,分别丢给小模型和大模型,看输出质量差多少。以 OpenAI 兼容接口为例:
from openai import OpenAI
client = OpenAI(api_key="your-key", base_url="https://api.openai.com/v1")
def ask(model, prompt):
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return r.choices[0].message.content
prompt = "用一句话解释什么是涌现行为"
# 小模型 vs 大模型,看输出清晰度差距
print("【小模型】", ask("gpt-3.5-turbo", prompt))
print("【大模型】", ask("gpt-4o", prompt))
# 通常大模型的解释更准确、更凝练——这就是规模红利的缩影
没有现成 API 也没关系,去 HuggingFace 上随便挑两个不同参数量的开源模型(比如 1.5B 和 14B 的对比),同问一个问题,亲见"涌现"不是玄学。
🃏 更省事的玩法是直接点开上面那张 参数规模交互卡 t.cloudlab.top/4KX6XC,浏览器里拖一拖就够直观。
写到最后:这个系列打算怎么更
这是系列第 2 篇,后面还会按"基础 → Prompt → RAG → Agent → 微调部署 → 评测 → 安全 → 工程化"的顺序一篇篇往下走。每篇都是一张卡讲透一个概念,配上能点开玩的交互演示,再给可以抄走的代码或参数表。整套 22 篇,读完你会拥有一张别人没法轻易塞给你的大模型知识地图。
写这种图文 + 交互长文挺费劲——一张卡要不要讲到位、代码能不能直接跑、表格是不是真能"抄作业",每处都得磨。所以如果你读下来觉得真有用、不想下次又翻半天找不到:
- 👍 点个赞,让我知道这种"图文+交互+代码"的写法值得继续做下去;
- ⭐ 收藏起来,参数规模 / 涌现 / 三阶段是后面所有原理文章的地基,回来翻的概率比你想的高;
- 💬 关注一下,下一篇"Prompt 写错了效果差 5 倍:context / 零样本 / 少样本 / 思维链"会尽快更上,关注了就不会错过。
如果这篇哪里没讲清楚、或者你想看的概念系列里还没排上,评论区直接说,我会一条条回,也按大家最想看的优先排期。
系列导航 & 持续更新
📚 下一篇预告:同一模型效果差 5 倍?你的 Prompt 写错了——context / 零样本 / 少样本 / 思维链 CoT 全讲透
如果这篇对你有帮助,点个👍收藏,参数规模和涌现是理解大模型原理绕不开的地基。有问题欢迎评论区交流,我会逐条回复。
更多推荐


所有评论(0)