大模型的训练
预训练(Pre-training)
预训练的过程类似于从婴儿成长为中学生的阶段。在这个阶段,我们会广泛接触各种知识:语文、数学、历史、自然等等,逐渐形成语言习惯、常识体系和对世界的初步理解。对于大模型来说,在这个阶段它会从海量的互联网文本中学习,掌握语言的统计规律、事实性知识以及上下文关联能力。但它本质上只是学会了“预测下一个词”或“补全句子”,并没有真正理解人类提问的意图。例如,如果我们向一个仅经过预训练的模型提问:“埃菲尔铁塔在哪个国家?”,它可能不会直接回答“法国”,而是延续语料中的常见模式,输出类似“东方明珠在哪个城市?”这样的无关内容。这说明它虽然“知道很多”,却还不懂得“如何回应人的请求”。因此,我们需要通过监督微调(SFT)来教会它遵循指令。人类成长的过程实质上是不断预训练的过程,这与机器的预训练过程略有不同。
监督微调(SFT,Supervised Fine Tuning)
SFT的过程类似于从中学生成长为大学生的阶段。在这个阶段,我们不再只是泛泛地学习,而是开始接受有目标的指导。老师会教我们如何答题、如何写论文、如何解决具体问题。对于大模型来说,在这个阶段它会学习大量由人类精心构造的“指令-回答”样本,涵盖日常对话、逻辑推理、专业问答等多种场景。通过这些示范,模型学会将用户的输入理解为明确的指令,并给出有针对性的回应。此时,如果我们再问它:“埃菲尔铁塔在哪个国家?”,它就能正确回答“法国”,而不是机械地续写句子。经过SFT,模型已经具备了基本的指令遵循能力和任务完成能力。但它仍可能输出不恰当的内容——比如包含偏见、虚假信息、不安全言论等,因为它只学会了“怎么答”,还没学会“什么该答、什么不该答”。
对齐偏好(Preference Alignment)
对齐偏好的过程类似于从大学生步入职场的阶段。在这个阶段,我们开始实际工作,但光有能力还不够,还需要理解客户和同事的期待——哪些表达得体,哪些可能冒犯他人,哪些方案更受欢迎。我们会根据他人的反馈不断调整自己的言行,以更好地融入社会、赢得信任。 对于大模型来说,在这个阶段,它会针对同一个问题生成多个不同的回答,由人类评估者根据有用性、安全性、礼貌性、事实准确性等标准进行比较和选择。模型通过学习这些“人类更喜欢哪个回答”的信号,逐渐调整自己的输出方式,使得回答不仅正确,而且更符合人类的价值观和交流习惯。 实现对齐的方式有很多:基于人类反馈的强化学习(RLHF,Reinforcement Learning from Human Feedback),先用人类标注的数据训练一个“评分老师”(奖励模型),再让这个“老师”指导大模型改进回答。DPO(Direct Preference Optimization),跳过训练“老师”的中间步骤,直接根据人类偏好数据优化模型本身。这个方法简化了训练流程,效果也很好。无论采用哪种方法,目标都是一致的:让模型不仅能“答对问题”,还能答得“让人放心”,避免有害、歧视、违法或令人不适的内容,成为一个既聪明又值得信赖的伙伴。
文章内容整合于网络,如有侵权,请联系删除!
更多推荐




所有评论(0)