大模型微调LoRA技术解析
·
LoRA论文:LoRA: Low-Rank Adaptation of Large Language Models
原视频:【LoRA微调】从原理到调参,7 个问题彻底理解LoRA

1. 什么是LoRA:举例说明



2. 为什么需要LoRA


3. 数学原理

奇异值分解



低秩矩阵:信息量主要集中在少数几个方向

为什么可以对增量权重矩阵低秩分解


可以对原始权重矩阵低秩分解吗

4. LoRA如何更新参数

初始化


LoRA的缩放因子(超参)
上图中的第4步中的 α/r 是 LoRA 的缩放因子,控制 LoRA 分支对原始模型的影响强度

经验起点是 r=8,α=16,即 α/r=2,意思是 LoRA 分支的输出会被放大 2 倍
5. LoRA可以用在Transformer的哪些层

注意力层&前馈层FFN

其他层

6. LoRA有哪些改进版本
LoRA+(对A和B矩阵设置不同的学习率,加速收敛)

DoRA(将W分解为幅度&方向,幅度单独训练,方向LoRA)

增
rsLoRA(系数分母变为根号r)& PiSSA(A和B初始化使用SVD)

GaLore(将全权重梯度投影到低秩空间,内存极低但每步投影)

如何选择

7. LoRA训练时需要调整哪些超参数

调参技巧

更多推荐



所有评论(0)