LoRA论文:LoRA: Low-Rank Adaptation of Large Language Models

原视频:【LoRA微调】从原理到调参,7 个问题彻底理解LoRA


1. 什么是LoRA:举例说明


2. 为什么需要LoRA


3. 数学原理

奇异值分解

低秩矩阵:信息量主要集中在少数几个方向

为什么可以对增量权重矩阵低秩分解

可以对原始权重矩阵低秩分解吗


4. LoRA如何更新参数

初始化

LoRA的缩放因子(超参)

上图中的第4步中的 α/r 是 LoRA 的缩放因子,控制 LoRA 分支对原始模型的影响强度

经验起点是 r=8,α=16,即 α/r=2,意思是 LoRA 分支的输出会被放大 2 倍


5. LoRA可以用在Transformer的哪些层

注意力层&前馈层FFN

其他层


6. LoRA有哪些改进版本

LoRA+(对A和B矩阵设置不同的学习率,加速收敛)

DoRA(将W分解为幅度&方向,幅度单独训练,方向LoRA)

rsLoRA(系数分母变为根号r)& PiSSA(A和B初始化使用SVD)

GaLore(将全权重梯度投影到低秩空间,内存极低但每步投影)

如何选择


7. LoRA训练时需要调整哪些超参数

参数介绍 - LLaMA Factory

调参技巧

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐