一文搞懂大模型核心原理:从 Token 到 GPT 的完整技术脉络
引言:大模型为什么会“说话”
以 ChatGPT 为代表的对话式 AI 已经渗透到日常工作和生活中,它们不仅能聊天、写代码,还能帮我们润色文案。很多人觉得大模型很神秘,仿佛真的拥有了智慧。但其实,大模型的底层就是一个猜得极其精准的数学函数。
这篇文章会用最通俗的语言,把从 Token、Embedding、注意力机制到 Transformer 架构、训练流程和生成控制串联起来,让你彻底理解“生成式预训练 Transformer”(GPT)究竟是如何工作的。
1. Token:为什么不是“词”
当我们和 ChatGPT 对话时,你输入的文字首先会被切分成更小的单元,这些单元就叫 Token。很多人会问:为什么不直接用“词”作为最小单位呢?
答案是:词太多了。世界上的语言千万种,每种语言又有几十万甚至上百万的词汇,如果以词为单位建立字典,词典会巨大到无法训练。更致命的是,新词会不断出现(比如网络流行语、专有名词),模型永远认不全。
因此,现代大模型普遍使用 子词分词 算法(如 BPE)。它会把常见的词根、词缀保留,将生僻词拆成更小的片段。例如 tokenization 可能被切成 token 和 ization。这样即便遇到从未见过的词,模型也能通过组合已知片段来理解,同时将词汇表大小控制在一个合理的范围(如 5 万个 Token 左右)。每个 Token 都有一个唯一的整数编号,这就是它在模型眼中的“身份证”。
2. 从编号到坐标:Embedding 与位置编码
光有编号还不够,因为数字之间没有语义关系——比如 Token“猫”是 1289 号,“狗”是 3412 号,模型无法从这两个数字里看出它们是动物。我们需要为每个 Token 分配一个“地址坐标”,让含义相近的词在空间中距离更近。这个过程叫 Embedding(词嵌入)。
Embedding 本质上是一个巨大的查找表,将每个 Token 编号映射到一个高维向量(比如 768 维或 4096 维)。在这个向量空间里,会出现神奇的性质:
- 国王 - 男人 + 女人 ≈ 王后
- “苹果”离“香蕉”比离“汽车”更近
这种“语义即方向”的特性,正是高维空间的精妙之处:每一个维度并不单独代表某个具体的属性(比如第 1 维是“大小”、第 2 维是“颜色”),而是整个向量的方向共同编码了语义。因此,向量的加减运算能够像上面那样,沿着“性别”“类别”等隐含方向平移,呈现出类比关系。
不过,从查找表直接拿到的这个 Embedding 向量是静态的,它只能给一个词一个“通用坐标”。比如“苹果”这个词,一开始既可能指水果,也可能指手机品牌,它的初始向量往往处于一个折中的中立位置,两种语义都沾一点。真正让词义变清晰的,是后续的 Transformer 层——当“苹果”出现在“吃苹果”或“苹果发布新机”这样的上下文中时,模型会层层调整它的向量,让它从“中立点”动态移动到符合当前语境的确切位置。这样,同一个“苹果”在不同句子里最终会得到不同的表示,这就是上下文化词嵌入的力量。
这里要特别补充一点:Token 编号被转换成 Embedding 向量后,模型并不知道这些 Token 的顺序。如果不告诉它“我-爱-你”中“我”在第一个、“爱”在第二个,在它眼里这就只是三个孤立的点。因此,我们还需要为每个位置注入 位置编码——也就是“分配地址坐标”的真正含义。位置编码将顺序信息叠加到 Embedding 向量上,让模型知道谁在前、谁在后。
3. 理解上下文:注意力机制与 QKV
拿到带有位置信息的向量序列后,模型要开始理解每个词在当前语境下的真实含义了。最经典的例子就是“苹果”——它到底是水果,还是手机品牌?这完全取决于上下文。注意力机制(Attention)就是用来动态捕捉这种上下文关系的。
注意力机制的核心是 QKV 三个角色:
- Query(查询):当前词想要查询的信息,相当于它向周围喊:“谁和我有关系?”
- Key(键):每个词对外提供的标签,回应:“我是什么,我有哪些特征。”
- Value(值):每个词实际携带的信息,当“我”被选中后,就提供这份内容。
具体计算过程(简化版):
- 从当前词的向量出发,通过一个权重矩阵变换得到 Q;
- 把上下文中所有词的向量分别变换成各自的 K 和 V;
- 用 Q 与所有词的 K 做点积,算出相似度分数;
- 将分数通过 Softmax 转化为权重,谁的权重高,说明谁和当前词关系更密切;
- 用这些权重对所有 V 做加权求和,得到的结果就是融合了上下文信息的新向量。
在“吃苹果”里,通过 Q-K 相似度计算,模型会发现“苹果”与“吃”的关联度极高,于是“水果”的语义就会被强化;而在“买苹果”且上下文有“发布会”“手机”时,“品牌”义则占上风。整个过程完全由数据驱动,让模型学会了自动消歧。
4. Transformer:从下往上的一体化流水线
我们现在可以把整个 Transformer 架构“从下往上看”串起来了:
- 输入层
输入文本 → 切分成 Token → 查表得到 Embedding 向量 → 加上位置编码 → 得到一个矩阵X(形状为[序列长度 × 向量维度])。 - 多层处理(Transformer Block)
每个 Block 包含两个核心组件:- 多头自注意力(Multi-Head Self-Attention):执行上面讲的 QKV 流程,并且用多组独立的 QKV 同时关注不同维度的关系(比如一组关注语法,一组关注语义)。
- 前馈神经网络(FFN):对每个位置的向量做一次独立的全连接变换,增强表达能力。
- 输出层
最后一个 Block 输出的最后一个位置的向量,被送入一个线性分类器(即一个全连接层加 Softmax),算出词汇表中每一个 Token 作为“下一个词”的概率分布。
所以,Transformer 本质就是一个 输入序列到下一个 Token 概率分布的映射函数,参数量可达数千亿。
5. 从随机到精准:模型是怎么变强的
你可能会问:这么多参数,一开始是随机的,它是怎么一步步变强的?
5.1 预训练:猜下一个词
大模型的起点是 预训练。我们找来互联网上海量的文本,把每篇文章都当成一道“完形填空”题:给定前文,让模型猜真正出现的下一个 Token 是什么。
因为参数一开始是随机的,猜出来的结果肯定和正确答案相去甚远。这时引入 损失函数(交叉熵损失),用来定量衡量“猜的分布”和“正确答案分布”之间的差距——这个差距就叫 loss。loss 越小,说明猜得越准。然后通过反向传播算法,沿着让 loss 下降最快的方向,一点一点微调模型的全部参数。当模型看过几万亿个 Token 后,它就成了一个“超级完备填空高手”,这种仅仅通过“猜下一个词”来学习的方法,就叫 生成式预训练。
5.2 从猜文本到对话:人工标注与对齐
此时模型只会续写文本,你问它一句“怎么做红烧肉?”,它可能会续写出一堆相关的菜谱标题,而不是直接给你菜谱。要让模型学会对话,就需要 监督微调(SFT):由人工撰写出高质量的多轮对话示例,在这些数据上继续训练模型。模型会模仿人类给出的回答风格,学会“问答”这一行为模式。
但是,一个问题往往有多种合理答案,如何让模型选择人类更喜欢、更有用、更安全的那个?这就用到了 基于人类反馈的强化学习(RLHF):先让人类对多个回答进行排序,训练一个“奖励模型”来模仿人类偏好,再用强化学习微调大模型,使它生成的回答能拿到更高的奖励分。经历这一系列流程后,模型才从单纯的“猜文本”进化为能和你自然对话的助手。
6. 控制生成:Temperature、Top-k 与 Top-p
即使训练完毕,在生成每个词时,模型输出的仍然是一整个词汇表的概率分布。如果我们每次都选概率最高的那个 Token,文本会变得非常死板,而且容易陷入重复。为了让输出既流畅又富有创造性,我们需要一些采样策略:
- Temperature(温度)
在 Softmax 之前,将 logits 除以温度系数 T。T 越小,概率分布越“尖锐”,模型越倾向于选择概率最高的词,结果更加确定和保守;T 越大,分布越“平滑”,概率较低的词也获得了更多出场机会,输出更天马行空。 - Top-k 采样
只从概率最高的 k 个候选 Token 中随机挑选,把那些胡言乱语的低概率词直接屏蔽。 - Top-p(核采样)
不再固定数量,而是按概率从高到低累加,直到累计概率达到阈值 p,然后只在这个动态截取的集合里采样。这样能根据置信度灵活调整候选范围,是目前最主流的策略。
通常这几者会组合使用(例如设置 T=0.8,top-p=0.9),在创意和可靠性之间取得平衡。
7. GPT 究竟是什么
现在来看 GPT 这个缩写就一目了然了:
- Generative —— 生成式,目标是产生新内容;
- Pre-trained —— 预训练,在海量数据上先学会语言规律;
- Transformer —— 以 Transformer 架构为骨干网络。
所以,GPT 的全称就是“基于 Transformer 架构、通过大规模预训练而得到的生成式模型”。它底层的本质,就是用数千亿个参数近似出来的一个极其精准的数学函数:
P(下一个 Token ∣ 前文)
每一次对话,本质都是这个函数在完成一道超大规模的条件概率计算题。
结语:一个猜得极其精准的数学函数
回到文章开头那句话——大模型的底层就是一个猜得极其精准的数学函数。从把文字切成 Token,为它赋予 Embedding 坐标,到在注意力机制的指挥下融合上下文,再到最后从概率分布中采样出下一个词,整个流水线精密运转。它不“理解”世界,它只是在无数次猜词训练后,学到了人类语言中那些精妙的统计规律。
理解了这个过程,你不仅明白了大模型的本质,也更容易在日常使用中写出更好的提示词——因为你知道,你面对的不是一个会思考的大脑,而是一个被数学公式雕琢出来的、概率世界里的顶级预言家。
拓展阅读建议
- 《Attention Is All You Need》—— Transformer 原始论文
- OpenAI 的 GPT 系列技术报告
- HuggingFace 推出的 Transformers 库,可亲手体验 Tokenizer 和模型推理
希望这篇文章帮你建立起了对大模型从下而上的完整认知。如果觉得有帮助,欢迎点赞、收藏,让更多朋友看懂 AI 的底层奥秘。
更多推荐



所有评论(0)