推理大模型后训练核心问题:当我们已经知道"一个好答案应该满足哪些条件"时,能不能让模型在生成的每一步上都直接收到这种细粒度的反馈,而不是只在最后拿到一个孤零零的分数?

让推理模型在数学、代码、科学问答上变强,目前主流的后训练手段大致是两条路线。它们都很有效,但都有一个结构性的缺陷。

三种监督信号的差异

路线 A:可验证奖励的强化学习(RLVR / GRPO)

以 GRPO 为代表的方法,让模型采样出完整回答,然后用一个标量奖励来优化——答案对了给高分,错了给低分(或者用单元测试是否通过来判定)。

它的问题在于奖励太稀疏、太粗

  • 奖励只在整条回答生成完之后才给出,是"结果级(outcome-level)"的;
  • 一个标量分数压根说不清楚为什么这条轨迹好或坏;
  • 两条犯了完全不同错误的回答,可能拿到一模一样的奖励。

这就造成了在线学习里经典的credit assignment瓶颈:模型知道自己被扣分了,但不知道扣在哪一步、扣在什么维度上。

后来有人用 LLM-as-a-Judge 把这套方法扩展到"难以验证"的开放式任务(比如科学论述、研究问答),甚至引入 rubric让打分更可靠。但rubric 信息最终还是被压缩成了一个标量奖励——评分细则里那些丰富的、分维度的文本判断,在优化的那一刻被丢掉了。

路线 B:在线自蒸馏(OPSD)

另一条路线用"稠密的教师监督"替代稀疏奖励。在 On-Policy Distillation(OPD)On-Policy Self-Distillation(OPSD) 中:

  • 学生从自己采样出推理轨迹(on-policy,避免了离线蒸馏的分布失配);
  • 一个"特权教师"沿着学生的轨迹,在每个 token 上提供指导。

这比"只看最终答案"的奖励稠密多了。但 OPSD 有个关键约束:教师是被一个参考答案(reference answer)条件化的。也就是说,监督信号被绑定在某一条具体的、特权的推理轨迹上。

问题就出在这里——一条参考轨迹只代表"一种正确的推法",而不是"一个好答案应该满足的那些属性"。当学生的推理路径稍微偏离参考轨迹,教师就可能鼓励它做全局性的改写,而不是定点修正某个局部错误。论文里观察到的现象是:OPSD 的轨迹经常反复重算同一个中间量、或者在没有新信息的情况下回头修改前面的步骤,导致推理链又长又冗余。

一句话总结两条路线的缺陷:
RL 把反馈压成了一个数字;OPSD 把反馈绑死在一条路径上。

二、核心洞察:rubric 不该只用来"打分",而该用来"塑形"

这篇工作的出发点非常清晰。Rubric(评分细则)本质上是把"答案质量"拆解成一组明确的、可解释的标准,比如:

Essential (权重 5):  必须显式用上 3% 的效率因子
Important (权重 3):  正确计算 E = hc/λ
Important (权重 2):  最终数量级应接近 10^19 个光子/秒
Pitfall   (权重 -1): 不能漏掉对频率 ω 的依赖

它天然回答的是"一个强回答应该满足什么(what)“,而不是"应该怎么一步步推出来(how)”。

观点:

rubric 不应该只在生成之后给回答打分,它应该在优化过程中塑造 token 级的学习。

具体做法:不要把 rubric 折叠成标量奖励,而是把 rubric 作为特权上下文喂给教师模型,让教师沿着学生自己采样的轨迹,给出"标准感知(criterion-aware)"的 token 级指导。

这样得到的训练信号同时具备三个性质:

  1. Criterion-aware(标准感知):保留了不同评估维度之间的区分;
  2. On-policy(在线):作用在学生自己生成的轨迹上,而不是固定的离线轨迹;
  3. Token-level(token 级):稠密指导,不把反馈缩成一个数字。

一张图看懂三种监督信号的差异

下面这张图用同一条"错误的学生轨迹"对比了三种方法的优化信号。问题是:“一个 100W、效率 3% 的灯泡每秒发射多少可见光子(~5000Å)?”

三种方法在同一条错误轨迹上的优化信号对比

  • RL / GRPO(红):最终答案错了 → 整条序列拿到同一个奖励 0,每个 token 收到的信号完全一样。模型无从知道是哪一步出了问题。
  • OPSD(蓝):教师被参考答案条件化,沿轨迹给出 token 级信号(+0.2 / +0.1 / +0.9 / …)。信号确实稠密了,但它在"推向那条特定的参考解法"。
  • RCSD(绿):教师被 rubric 条件化。注意看——它在"显式用上效率因子"那一步给了强烈的负信号(-2.4),因为学生恰恰漏掉了这个 Essential 标准;而对那些做对的步骤(如 E=hc/λ)给了正向的 +1.1。正确的步骤被保留,特定的局部错误被精准惩罚。

这就是"标准感知的 token 级反馈"的直观含义:它既稠密,又能分维度地做信用分配。

三、方法框架:两阶段流水线

RCSD(Rubric-Conditioned Self-Distillation)把整个想法拆成两个顺序阶段。直觉上:

Stage I 学的是"一个强回答应该满足什么";Stage II 学的是"如何沿着学生自己的轨迹去实现这些标准"。

下图把 RCSD 放在 RL 和 OPSD 的对照中,并展示了两阶段的结构:

RCSD 与 RL / OPSD 的对比,以及两阶段流水线

  • 左:RL 是结果级监督(一个标量奖励)。
  • 中:OPSD 是 token 级监督,但教师被参考答案 y* 条件化(图里也点明了痛点:Gold answer can be correct with incorrect CoT——标准答案对,但思维链可能是错的)。
  • 右:RCSD 把监督接口重新定义了。教师不再被单一参考轨迹条件化,而是被一个指定标准级属性的 rubric 条件化;Stage I 学习问题特定的 rubric,Stage II 复用它来诱导结构化的 token 级指导。

先约定符号

  • pTp_TpTpSp_SpS 分别是教师和学生的分布;
  • 输入问题 xxx,对应两个结构化输出:rubric rrr 和答案 yyy
  • 一个 rubric 是一组问题特定的评估标准 r={c1,…,cK}r = \{c_1, \dots, c_K\}r={c1,,cK},每个标准 ckc_kck 含有标题、自然语言描述、重要性权重(权重来自 Essential / Important / Optional / Pitfall 四档)。

关键设定:rubric 是特权监督(privileged supervision)——训练时提供给教师,推理时学生拿不到。所以需要把它蒸馏进学生。又因为高质量 rubric 很贵,文章把"生成 rubric"这件事也自动化了,于是有了两阶段。

Stage I:学一个 Rubric 生成器

目标:训练一个模型,仅凭问题 xxx 就能预测出 rubric rrr,把昂贵的"实例特定评估标准"摊销(amortize)成一个可复用的生成器。

这一阶段本身就是一次 on-policy 自蒸馏:

  • 学生 rubric 生成器只看问题:pSR(r∣x)p_S^R(r \mid x)pSR(rx)
  • 教师 rubric 生成器有特权——能看到问题和参考答案 y⋆y^\starypTR(r∣x,y⋆)p_T^R(r \mid x, y^\star)pTR(rx,y)

注意一个微妙但重要的点:参考答案不是被当作"要照抄的监督目标",而是作为一种特权上下文,帮助教师在自己的分布内推断出应该生成什么样的 rubric。

训练损失是沿学生自己采样的 rubric 轨迹 r^∼pSR(⋅∣x)\hat r \sim p_S^R(\cdot \mid x)r^pSR(x) 做 token 级 KL 对齐:

这样既保留了 on-policy 自蒸馏的好处(学生在自己的前缀上训练,而非教师生成的前缀),又让教师能把参考答案里的特权信息注入到 rubric 生成过程中。训练完,这个生成器在测试时不需要任何特权输入就能产出问题特定的评估标准。

Stage II:Rubric 条件化的推理

目标:给定 rubric,训练一个推理器(reasoner),让它生成更能满足实例特定标准的答案。

最关键的设计选择:rubric 不是简单地作为提示文本拼接给学生。相反,它作为特权上下文提供给教师,由教师沿着学生自己的轨迹给出标准感知的 token 级指导。

  • 学生推理器只看问题:pSY(y∣x)p_S^Y(y \mid x)pSY(yx)
  • 教师推理器看问题 + rubric:pTY(y∣x,r)p_T^Y(y \mid x, r)pTY(yx,r)(这里的 rrr 就是 Stage I 生成器产出的学习到的 rubric)

沿学生在线轨迹 y^∼pSY(⋅∣x)\hat y \sim p_S^Y(\cdot \mid x)y^pSY(x) 优化:

它的核心价值在于:标准级结构被保留在教师信号本身里,所以优化能够区分不同维度的"部分正确",而不是把它们压成一个无差别的分数。

训练流程

值得强调的是:整个过程不需要单独的奖励模型或裁判(judge)。教师就是模型自己(被 rubric 条件化的版本),这使得 RCSD 成为一种**无验证器(verifier-free)**的后训练方案——这在那些"好答案无法用精确匹配 / 单元测试判定"的开放式任务上尤其有价值。


另外,生成的 rubric 不必和参考 rubric 一字不差【生成的 rubric 不需要在措辞或表面形式上精确匹配参考 rubric,只要它在学生实际访问到的前缀上,诱导出的教师分布足够接近就够了。这正好对应 Stage I 的实际角色——生成器只要产出"足够有用"的 rubric,能保住 Stage II 的教师侧指导即可。】

实验

参考文献

Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation,https://arxiv.org/pdf/2606.19327v1

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐