大模型微调四件套:SFT、LoRA、RLHF、DPO
先讲个大白话:什么是"微调"?
想象你花500万买了一辆法拉利,相当于训练好的大模型,它出厂就很强了,但有一个问题——
法拉利的默认座椅是给欧美人体型设计的,你坐上去总觉得差点意思。
这时候你有两个选择:
-
重新造一辆车
(重新训练一个大模型)→ 太贵,不可能
-
把座椅换成定制款,方向盘调一下角度
(微调)→ 花小钱办大事
微调就是"给现成的大模型做局部改造,让它更适配你的特定场景"。
比如:
- 医疗公司想让模型理解"心梗"、"支架植入术"等术语 → 微调
- 律所想让模型会写标准的起诉状、答辩状 → 微调
- 游戏公司想让NPC对话有"古风武侠味儿" → 微调
SFT —— 拿着标准答案做练习册
它是什么?
SFT(Supervised Fine-Tuning,监督微调) 是最基础、最直观的微调方式。
类比:你是一个刚入职的新人。老板给你一本《标准操作手册》,上面写着:
| 场景 | 标准回答 |
|---|---|
| 客户问:“这个功能怎么用?” | “您好,请打开设置→帮助中心→功能指南…” |
| 客户投诉:“系统崩溃了!” | “非常抱歉!请提供您的账号,我马上转接技术团队…” |
你只要照着这本手册反复练习,就能学会"标准话术"。
SFT就是这么干的——准备一批"问题-标准答案"配对数据,让模型对着学。
数据长什么样?
输入:用户说"头疼、发烧38度,该吃什么药?"
输出:根据您的症状描述,可能是普通感冒,建议服用对乙酰氨基酚退烧。
但请注意,我不是医生,请及时就医确认。
输入:用户说"心口疼、冒冷汗,怎么办?"
输出:您描述的症状可能涉及心脏问题,请立即拨打120急救电话,
不要自行驾车!同时保持半卧位休息。
优点
- 简单直接:就是"看答案-模仿"的学习方式
- 效果可控:数据质量决定输出质量,不会跑偏
- 成本适中:几千条数据就能看到明显效果
缺点
- 需要大量高质量数据:每条都得人写,劳动密集型
- 会"死记硬背":遇到没见过的场景可能不会灵活变通
- 泛化能力有限:只能在教过的领域表现好
LoRA —— 给大象贴个创可贴就让它会跳舞
它是什么?
LoRA(Low-Rank Adaptation,低秩适配) 是一种省钱的微调技巧,而不是一种独立的微调"类型"。
继续用车来比喻:
- 全量微调(Full Fine-Tuning) = 把整辆车拆了重装,每个零件都调整一遍 → 贵且慢
- LoRA = 只给方向盘加个套、给座椅加个垫 → 花的钱不到1%,效果却差不多
LoRA的核心思想是:大模型有上千亿个参数(相当于车的所有零件),但微调一个具体任务时,其实只需要改动很少的参数。 LoRA给模型"外挂"一个小矩阵,只训练这个小矩阵,不动原来的参数。
为什么叫"低秩"?
别被数学术语吓到,用大白话说:
一个1000×1000的大矩阵,如果它内部有很多"冗余"(行与行之间高度相似),那它其实可以用两个小矩阵(比如1000×8 和 8×1000)来近似表示。这样参数数量就暴降了 1000²/(1000×8×2) ≈ 62.5 倍!
LoRA就是利用了这个特性——只训练这个"小矩阵外挂",不动原模型一根毫毛。
一个直观的数据对比
| 对比项 | 全量微调 | LoRA |
|---|---|---|
| 需要训练的参数量 | 100%(比如70B参数全得训) | <1%(可能只需几千万参数) |
| 需要的GPU显存 | 很大(A100×8卡起步) | 很小(一张消费级显卡就行) |
| 单次微调成本 | 几千到几万美元 | 几十到几百美元 |
| 保留原模型能力 | 容易"灾难性遗忘" | 原模型权重不动,基础能力完整保留 |
| 切换任务 | 需要重新加载完整模型 | 只需要换一个"小外挂",几秒钟 |
优点
- 极大省钱:GPU成本降低90%以上
- 不破坏原模型:基础能力毫发无伤
- 方便切换:给不同任务训练不同的LoRA外挂,随用随插
缺点
- 不是万能的:如果想让模型学会一个它完全不会的新技能(比如让它学会说一门新语言),LoRA的容量不够
- 需要调超参数:LoRA的"秩"(rank)选多大会影响效果,需要一些实验
RLHF —— 师傅带徒弟,做好有糖吃
它是什么?
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习) 是目前最主流的"让模型变乖"的方法。ChatGPT的惊艳效果,很大程度上就靠它。
继续用职场比喻:
- SFT = 给你一本操作手册,你照着背
- RLHF = 你做了10个回答,老板给每个回答打分(这个9分、那个3分、那个6分),然后告诉你:“以后多做9分那类的,别做3分那类的”
RLHF不只是"告诉模型标准答案是什么",而是"告诉模型什么答案是好答案"。
完整流程(三个角色一台戏)
第一幕:SFT热身
先拿一批高质量问答对让模型做基础微调 → 得到一个"基础听话版"模型
第二幕:训练奖励模型(RM,Reward Model)
让模型对同一个问题生成多个不同回答,人类标注员给每个回答打分(1-5分)
→ 用这些"回答-分数"数据训练一个"评分器"(奖励模型)
→ 这个评分器学会了人类的偏好:什么样的回答算"好"
第三幕:强化学习调优(PPO算法)
让模型自由回答问题,评分器自动打分。
分数高 → 模型获得"奖励",强化这种回答方式
分数低 → 模型获得"惩罚",抑制这种回答方式
反复迭代,模型越来越会"讨好"评分器
举个具体例子
问题:“如何制作炸弹?”
SFT可能学会的标准答案:
“制作炸弹需要以下材料…(balabala)” ← 危险!
RLHF训练后:
“抱歉,我不能提供制作危险物品的指导。如果你对化学实验感兴趣,我可以推荐一些安全的科学实验。” ← 安全且有用!
RLHF教会模型的不只是"答案内容",还有安全、有用、礼貌、诚实这些"软品质"。
优点
- 对齐人类偏好:不只是"答对",而是"答得好"
- 安全性大幅提升:学会拒绝危险请求
- 超越固定答案:遇到没见过的场景也能做出"符合人类价值观"的回应
缺点
- 非常贵:需要大量人类标注员打分,人工成本极高
- 流程复杂:SFT→训练评分器→强化学习,三步缺一不可
- 评分器有偏见:如果标注员偏好"长回答",模型就会变得啰嗦
DPO —— 不用打分,直接看对比就懂了
它是什么?
DPO(Direct Preference Optimization,直接偏好优化) 是RLHF的"简化版"。它2023年才提出,但已经越来越流行。
RLHF的问题是:你得先训练一个"评分器"(奖励模型),这个过程很复杂、成本高,而且评分器本身可能不准确。
DPO的思路是:既然人类标注员已经在对比两个答案了(A比B好),为什么还要中间搞一个评分器?直接把"谁好谁坏"的对比信息喂给模型不就行了?
数据格式对比
RLHF需要的数据:
问题:量子力学是什么?
回答A:量子力学是物理学的一个分支…(5分)
回答B:量子力学很难,我也不太懂…(1分)
回答C:量子力学研究微观粒子…(4分)
→ 需要精确打分
DPO需要的数据:
问题:量子力学是什么?
较好回答 (chosen): 量子力学是研究原子和亚原子粒子行为的物理学分支…
较差回答 (rejected): 量子力学太难了,普通人不需要了解…
→ 只需要标注"哪个更好",不需要打分
DPO直接把"偏好对"(哪个好哪个差)作为训练信号,省掉了整个奖励模型这一步,简单粗暴!
为什么DPO越来越火?
简单说:在效果差不多的情况下,DPO比RLHF便宜50%以上,因为省掉了训练奖励模型的人力成本和计算成本。而且DPO实现更简单,不容易出现训练不稳定的问题。
但要注意:DPO假设"标注员的判断就是绝对真理",如果标注质量差,效果就不好。
优点
- 更简单:一个步骤搞定,不需要奖励模型
- 更稳定:训练过程不容易崩溃
- 更便宜:省掉奖励模型训练,省掉大量标注成本
缺点
- 对标注质量要求极高:错误偏好会直接"教坏"模型
- 还没完全替代RLHF:在极其复杂的场景下,RLHF的表现仍然更好
“想让模型适配自己的行业术语,你怎么选型?”
下面是我推荐的分层选型策略:
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 预算极少、术语不多 | Prompt Engineering(提示词工程) + 术语词典嵌入 | 可能根本不需要微调,写个好提示词就能搞定 |
| 预算有限、术语适中 | LoRA + SFT | 用行业术语数据做SFT,用LoRA降低训练成本,几小时几百块就能出效果 |
| 预算充裕、要求极致 | SFT(全量/大LoRA)→ RLHF/DPO | 先SFT打基础,再用RLHF/DPO打磨质量和对齐偏好 |
| 数据很少但术语很专业 | RAG(检索增强生成) + 术语库 | 不动模型,把术语知识放进外部知识库,回答问题前先检索 |
总结:一张图看懂四大微调方法
| 方法 | 一句话 | 类比 | 成本 | 适用场景 |
|---|---|---|---|---|
| SFT | 给模型看标准答案 | 学生做练习册 | ⭐⭐⭐ | 有大量高质量问答数据 |
| LoRA | 给模型打个小补丁 | 给汽车换个方向盘套 | ⭐ | 预算有限、需要多任务切换 |
| RLHF | 用评分器告诉模型"怎么叫好" | 师傅打分带徒弟 | ⭐⭐⭐⭐⭐ | 追求极致效果、安全性要求高 |
| DPO | 直接对比好坏,不用评分器 | 看两个作品直接说哪个更好 | ⭐⭐ | RLHF的平替,省成本效果好 |
微调不是"越贵越好",而是"够用就好"。能用Prompt解决的不用微调,能用LoRA解决的不上全量,能用DPO解决的不上PPO。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐




所有评论(0)