2bit 量化最新进展 ,数据训练和无损量化OSCAR / OScaR** 的**大模型 KV Cache 极低比特量化论文
·
你问的应该是 2026 年 5 月两篇几乎同时放出、都叫 OSCAR / OScaR 的大模型 KV Cache 极低比特量化论文(不是金融/多模态那几个同名 OSCAR)。下面把两篇合并解读,讲清楚:解决什么问题、核心思路、怎么做、效果、怎么用。
一、背景:为什么要 KV 量化?
LLM 推理瓶颈不在计算,而在 KV Cache 显存带宽与容量:
- 上下文越长(32k/100k),KV 占显存越多
- BF16:1 个 token 每头 K+V 要 2×2=4 字节
- INT2:只要 0.5 字节 → 省 8× 显存,带宽压力骤降
传统方案痛点:
- 直接 INT4/INT2:异常值(outlier)多,精度崩
- Hadamard 旋转:只能抹平异常,不考虑注意力怎么用 KV,误差大
- 通道量化(per-channel):序列间范数差异大(Token Norm Imbalance, TNI),极端比特下失效
二、两篇 OSCAR 总览(都 2026.5,arXiv)
1)OSCAR(Offline Spectral Covariance-Aware Rotation)
- 作者:Together AI + 悉尼大学 + UIUC
- 核心:离线统计注意力协方差 → 做固定旋转 + 阈值裁剪,让量化误差落在注意力不敏感方向
2)OScaR(Omni-Scaled Canalized Rotation)
- 作者:清华 + 美团 + 港大等
- 核心:定位 TNI 是 INT2 失效主因,用“通道化旋转 + 全序列缩放”解决,极简、易部署
下面重点讲第一篇(OSCAR),第二篇做对比。
三、OSCAR(Offline Spectral Covariance-Aware Rotation)核心解读
1. 核心思想
一句话:旋转不再是固定 Hadamard,而是按“注意力最关心的方向”来转,把误差赶到注意力不敏感维度。
流程:
-
离线阶段(只做一次)
- 用一批典型数据(如 32k 上下文)跑模型
- 统计 K/V 的协方差矩阵,并结合注意力权重,得到 注意力感知的主成分方向
- 算好固定旋转矩阵 R 和 INT2 裁剪阈值,存下来
-
推理阶段
- 每步 K/V:先乘 R 旋转 → 裁剪 → INT2 量化 → 存显存
- 注意力计算时:INT2 加载 → 反旋转 → 正常 FlashAttention
- 全程无训练、无在线统计、开销极低
2. 关键创新:为什么比 Hadamard 好?
- Hadamard:数据无关,随机打乱维度,误差均匀分布
- OSCAR:注意力感知,把维度分成“重要(注意力大)/不重要(注意力小)”
- 重要维度:尽量少误差
- 不重要维度:扛大部分量化误差
- 数学上:最小化“量化误差在注意力投影方向上的分量”
3. 效果(OSCAR)
- 模型:4B–400B(Llama 2、Mistral、GPT-4 级)
- 比特:≈2.28 bit/KV(接近 INT2)
- 精度:几乎无损,在长文本、代码(LiveCodeBench)上显著优于 Hadamard/INT4
- 速度:
- 大 batch:吞吐量 ↑7×(同显存)
- batch=1:解码 ↑3×(带宽瓶颈消除)
- 上下文 100k:吞吐量 ↑6.2×
4. 系统实现(可直接用)
- 自定义 INT2 注意力 CUDA kernel
- 兼容 vLLM / SGLang 分页 KV、前缀缓存
- 不用改模型结构,即插即用
四、OScaR(Omni-Scaled Canalized Rotation)要点(对比)
1. 核心发现:TNI 是杀手
- 不同 token 的 K/V 范数差异极大 → 共享量化参数时,大范数 token 误差被放大
- per-channel 治标不治本,INT2 下崩得厉害
2. 解法:Canalized Rotation + Omni-Token Scaling
- 通道化旋转:把 K/V 分成几组,组内旋转,抑制组内异常
- 全序列缩放:对每个 token 单独缩放,抹平 TNI
- 全程无矩阵求逆、无迭代,极简,适合多模态 LLM(X-LLMs)
3. 效果
- INT2 下精度接近 BF16,优于 OSCAR(第一篇)在部分任务
- 推理更快、显存更小、代码更简单
五、两篇 OSCAR 对比(一眼看懂)
| 维度 | OSCAR(Offline Covariance) | OScaR(TNI + Canalized) |
|---|---|---|
| 核心问题 | 旋转不匹配注意力 | Token 范数不平衡(TNI) |
| 旋转方式 | 离线协方差 + 注意力主成分 | 通道化分组旋转 |
| 缩放 | 固定阈值裁剪 | 逐 token 全序列缩放 |
| 部署 | 要离线统计,固定矩阵 | 无离线步骤,极简 |
| 精度 | 极优(长文本/代码) | 更稳(多模态/通用) |
| 速度 | 快(定制 kernel) | 更快(无复杂计算) |
六、工程启示(怎么用)
- 长文本推理(32k–100k):优先 OSCAR(第一篇),吞吐量提升最大
- 多模态/通用 LLM:优先 OScaR(第二篇),更稳、易集成
- 生产落地:
- 用 vLLM/SGLang 接入 INT2 kernel
- 离线统计一次,推理零开销
- 显存省 8×,速度 2–7×,成本直接砍半
七、一句话总结
OSCAR/OScaR 把 KV Cache 压到 INT2 还几乎不掉点:第一篇靠“注意力感知离线旋转”,第二篇靠“解决 Token 范数不平衡的极简旋转+缩放”,都是 2026 年 5 月长文本 LLM 推理的里程碑。
要不要我把两篇论文的核心公式、伪代码和关键实验图整理成一页速查版,方便你复现和汇报?
更多推荐




所有评论(0)