你问的应该是 2026 年 5 月两篇几乎同时放出、都叫 OSCAR / OScaR大模型 KV Cache 极低比特量化论文(不是金融/多模态那几个同名 OSCAR)。下面把两篇合并解读,讲清楚:解决什么问题、核心思路、怎么做、效果、怎么用


一、背景:为什么要 KV 量化?

LLM 推理瓶颈不在计算,而在 KV Cache 显存带宽与容量

  • 上下文越长(32k/100k),KV 占显存越多
  • BF16:1 个 token 每头 K+V 要 2×2=4 字节
  • INT2:只要 0.5 字节 → 省 8× 显存,带宽压力骤降

传统方案痛点:

  • 直接 INT4/INT2:异常值(outlier)多,精度崩
  • Hadamard 旋转:只能抹平异常,不考虑注意力怎么用 KV,误差大
  • 通道量化(per-channel):序列间范数差异大(Token Norm Imbalance, TNI),极端比特下失效

二、两篇 OSCAR 总览(都 2026.5,arXiv)

1)OSCAR(Offline Spectral Covariance-Aware Rotation)

  • 作者:Together AI + 悉尼大学 + UIUC
  • 核心:离线统计注意力协方差 → 做固定旋转 + 阈值裁剪,让量化误差落在注意力不敏感方向

2)OScaR(Omni-Scaled Canalized Rotation)

  • 作者:清华 + 美团 + 港大等
  • 核心:定位 TNI 是 INT2 失效主因,用“通道化旋转 + 全序列缩放”解决,极简、易部署

下面重点讲第一篇(OSCAR),第二篇做对比。


三、OSCAR(Offline Spectral Covariance-Aware Rotation)核心解读

1. 核心思想

一句话:旋转不再是固定 Hadamard,而是按“注意力最关心的方向”来转,把误差赶到注意力不敏感维度。

流程:

  1. 离线阶段(只做一次)

    • 用一批典型数据(如 32k 上下文)跑模型
    • 统计 K/V 的协方差矩阵,并结合注意力权重,得到 注意力感知的主成分方向
    • 算好固定旋转矩阵 RINT2 裁剪阈值,存下来
  2. 推理阶段

    • 每步 K/V:先乘 R 旋转 → 裁剪 → INT2 量化 → 存显存
    • 注意力计算时:INT2 加载 → 反旋转 → 正常 FlashAttention
    • 全程无训练、无在线统计、开销极低

2. 关键创新:为什么比 Hadamard 好?

  • Hadamard:数据无关,随机打乱维度,误差均匀分布
  • OSCAR:注意力感知,把维度分成“重要(注意力大)/不重要(注意力小)”
    • 重要维度:尽量少误差
    • 不重要维度:扛大部分量化误差
  • 数学上:最小化“量化误差在注意力投影方向上的分量

3. 效果(OSCAR)

  • 模型:4B–400B(Llama 2、Mistral、GPT-4 级)
  • 比特:≈2.28 bit/KV(接近 INT2)
  • 精度:几乎无损,在长文本、代码(LiveCodeBench)上显著优于 Hadamard/INT4
  • 速度:
    • 大 batch:吞吐量 ↑7×(同显存)
    • batch=1:解码 ↑3×(带宽瓶颈消除)
    • 上下文 100k:吞吐量 ↑6.2×

4. 系统实现(可直接用)

  • 自定义 INT2 注意力 CUDA kernel
  • 兼容 vLLM / SGLang 分页 KV、前缀缓存
  • 不用改模型结构,即插即用

四、OScaR(Omni-Scaled Canalized Rotation)要点(对比)

1. 核心发现:TNI 是杀手

  • 不同 token 的 K/V 范数差异极大 → 共享量化参数时,大范数 token 误差被放大
  • per-channel 治标不治本,INT2 下崩得厉害

2. 解法:Canalized Rotation + Omni-Token Scaling

  1. 通道化旋转:把 K/V 分成几组,组内旋转,抑制组内异常
  2. 全序列缩放:对每个 token 单独缩放,抹平 TNI
  3. 全程无矩阵求逆、无迭代,极简,适合多模态 LLM(X-LLMs)

3. 效果

  • INT2 下精度接近 BF16,优于 OSCAR(第一篇)在部分任务
  • 推理更快、显存更小、代码更简单

五、两篇 OSCAR 对比(一眼看懂)

维度 OSCAR(Offline Covariance) OScaR(TNI + Canalized)
核心问题 旋转不匹配注意力 Token 范数不平衡(TNI)
旋转方式 离线协方差 + 注意力主成分 通道化分组旋转
缩放 固定阈值裁剪 逐 token 全序列缩放
部署 要离线统计,固定矩阵 无离线步骤,极简
精度 极优(长文本/代码) 更稳(多模态/通用)
速度 快(定制 kernel) 更快(无复杂计算)

六、工程启示(怎么用)

  1. 长文本推理(32k–100k):优先 OSCAR(第一篇),吞吐量提升最大
  2. 多模态/通用 LLM:优先 OScaR(第二篇),更稳、易集成
  3. 生产落地
    • 用 vLLM/SGLang 接入 INT2 kernel
    • 离线统计一次,推理零开销
    • 显存省 8×,速度 2–7×,成本直接砍半

七、一句话总结

OSCAR/OScaR 把 KV Cache 压到 INT2 还几乎不掉点:第一篇靠“注意力感知离线旋转”,第二篇靠“解决 Token 范数不平衡的极简旋转+缩放”,都是 2026 年 5 月长文本 LLM 推理的里程碑


要不要我把两篇论文的核心公式、伪代码和关键实验图整理成一页速查版,方便你复现和汇报?

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐