深度学习✖️GPT
GPT模型完美地遵循了“层层抽象”这个核心思想,但它抽象的对象从“图像的像素”变成了“文本的Token(词元)”。它每一层都在做同一件事:把离散的、孤立的词语,逐步转换成包含丰富上下文语义的、连续的向量(特征)。
下面我分三步,把深度学习原理在GPT训练中的体现拆解清楚。
1. 输入层:把文字变成数字(词向量)
图像模型的第一层输入是“像素值”,而GPT的第一层输入是“词元”。
-
操作:首先,把输入的一句话(比如“猫爱吃__”)切分成一个个Token(如“猫”、“爱”、“吃”)。然后,通过一个嵌入层,把每个Token映射成一个高维的向量(比如一个包含768个数字的列表)。
-
体现的原理:这一步,相当于图像模型里第一层提取的“边缘信息”。只不过这里提取的是初始的、孤立的词义。此时,“猫”和“狗”的向量可能有一定相似性,但它们完全不知道自己在句子中的具体角色。
2. 隐藏层(核心):多头自注意力机制,实现“特征交互”
这是GPT与普通深度网络最大的不同,也是它“智能”的来源。在GPT的Transformer解码器层中,核心不再是“全连接”,而是自注意力机制。
这一层的输入:上一层的输出(每个词的向量)。
这一层的核心操作:让每个词去“看”句子里的所有其他词,并计算出它们之间的相关性强弱(注意力权重)。
-
比如,当处理“猫爱吃鱼”时,在“吃”这一层,它会分配很高的注意力权重给“猫”和“鱼”,而给“爱”的权重较低。
-
层层递进:
-
浅层(靠近输入):主要学习词法和局部语法,比如形容词和名词的搭配、主谓一致。
-
中层:开始学习句法和语义角色,比如谁(主语)对谁(宾语)做了什么(谓语)。
-
深层(靠近输出):开始学习上下文、指代关系乃至复杂的推理。比如明白“它”指代的是前文的“猫”。
-
你看,这完全符合我们之前说的“层层抽象”原理:浅层抽取出“词语”这个基础特征,中层组合成“短语结构”,深层抽象出“整句的逻辑关系”。
3. 输出层与最终目标:预测下一个词
这就是GPT训练最精妙的地方。它的最终目标不像图像分类是“输出一个类别标签”,而是输出一个概率分布。
-
操作:最后一层输出一个和词表大小一样的向量(比如有5万个数字),经过Softmax函数转换成概率。哪个词的概率最大,GPT就预测它是下一个词。
-
训练目标(损失函数):在训练时,我们拥有海量的文本语料(比如整本维基百科)。对于输入“猫爱吃”,我们知道标准答案“鱼”就在原文中。于是,损失函数会计算模型预测“鱼”的概率与“1”(正确答案)之间的差距,然后通过反向传播,去微调每一层的数十亿个参数(权重和偏置)。
4. 整个训练过程的宏观图景
把这三步串起来,GPT的训练就是:
输入大量文本 → 第一层把词转为孤立向量 → 中间几十层通过自注意力,不断让词向量吸收来自其他词的信息,进行“上下文交互” → 最后一层输出下一个词的概率 → 计算预测误差 → 反向传播,调整所有层的参数,让模型下次预测更准。
经过数千亿次这样的迭代,GPT最终得到的,就是一个包含海量世界知识和语言规律的、由数千亿个参数构成的巨大数学方程。它之所以能“理解”指令,是因为在它的“层层抽象”中,已经学会了人类语言的复杂模式和逻辑关系。
更多推荐




所有评论(0)