在 2026 年的前沿模型后训练中,Distillation(蒸馏) 已经从一个辅助技巧变成了核心武器。

很多团队在做 post-training 时会遇到同一个痛点:用 RL(强化学习)让模型在多个领域变强非常困难。一个阶段学到的技能,在下一个阶段训练时很容易退化。想让一个模型同时在数学、代码、Agentic 任务上都优秀,传统 RL 路线成本极高且效果不稳定。

蒸馏提供了一种更高效、更灵活的解决方案。它不再只是“让大模型教小模型”,而是演化出了三种不同形态,正在被几乎所有前沿实验室广泛采用。

第一阶段:Off-Policy 蒸馏 —— 经典的大老师教小学生

这是最传统的用法:用一个大而贵的 teacher 模型,去训练一个更小的 student 模型,让它模仿 teacher 的行为。

Gemma 3 和 Gemma 4 的技术报告都明确提到 post-training 依赖改进版的知识蒸馏。DeepSeek-R1-Distill 则是把 R1 的 reasoning traces 通过普通 SFT(硬标签)蒸馏到 Qwen 和 Llama 等更小的模型上。

这个阶段有两种信号形式:

  • 软标签(Soft labels):让 student 去匹配 teacher 的 next-token 概率分布(需要 white-box 访问)。
  • 硬标签(Hard labels):直接用 teacher 生成的文本来训练 student(black-box 也可行)。

R1-Distill 采用的就是硬标签方式。核心思想没变,只是信号形式不同。

第二阶段:On-Policy 蒸馏 —— 多领域专家融合(2026 最主流的做法)

这是今年大多数前沿实验室真正收敛的用法。

当你想让一个模型同时擅长多个领域时,传统 RL 会导致前面学到的能力在后面被破坏。解决方案是:为每个领域单独训练一个 RL expert(数学 expert、代码 expert、Agentic expert),然后通过 on-policy 蒸馏把它们融合进一个统一的学生模型。

关键特点:

  • Student 在生成 rollout(自己产生输出)的同时,多个 teacher 给出 token-level 的密集反馈。
  • Teacher 往往不是更大的模型,而是同一个 base model 的不同 checkpoint,只是被 RL 在单一领域推得更远。专业化比规模更重要

典型案例包括:

  • DeepSeek-V4:明确描述了先为每个领域训练 expert(SFT + GRPO),再用 on-policy distillation 训练统一模型,使用 reverse KL loss。
  • MOPD(Multi-Teacher On-Policy Distillation):多个 domain teacher 为 student 正在生成的 token 提供密集信号。
  • GLM-5:在不同训练阶段之间做蒸馏,用早期 checkpoint 作为 teacher,恢复之前退化的能力。
  • Nemotron 3 Ultra:用了超过 10 个 specialized teachers。
  • Qwen3:经典的大 teacher + 小 student 方向,据称成本仅为 RL 的约 1/10,且效果更好。

为什么有效?RL 的 reward 是一个序列的单一标量,而蒸馏能对 student 生成的每一个 token 给出反馈,收敛更快、所需计算资源更少。

第三阶段:Self-Distillation —— 模型自己教自己

这是最有趣的形态:完全不需要额外的 teacher 模型。

Cursor Composer 2.5 采用了一种 clever 的方式:在训练时给模型注入一个描述期望行为的 hint,让带 hint 的模型成为 teacher,去教不带 hint 的同一个模型。通过 per-token KL divergence,拉近两者的策略。最终模型在推理时不需要 hint 也能表现出期望行为(privileged teacher)。

Thinking Machines 则用另一种 self-teacher 方式:在新领域数据上 fine-tune 后,用 fine-tune 之前的 checkpoint 作为 teacher,通过蒸馏恢复被破坏的原有能力,同时保留新学到的知识。这本质上是一种持续学习(continual learning) 的方案。

Self-distillation 的核心洞见是:teacher 不一定需要更大,只要在特定上下文中表现更好即可。有时候,那个更好的版本就是模型自己(不同状态下)。

三种蒸馏方式对比

阶段 Teacher 来源 核心机制 主要用途 计算效率 典型代表
Off-Policy 更大/更强的独立模型 匹配 teacher 输出或分布 模型压缩 Gemma、DeepSeek-R1-Distill
On-Policy 同尺寸领域专家 checkpoint Student 生成 + 多 teacher 打分 多领域能力融合 极高 DeepSeek-V4、Nemotron 3、MOPD
Self-Distillation 模型自身(带 hint / 早期 checkpoint) 模型教自己 恢复能力 + 持续学习 最高 Cursor Composer、Thinking Machines

蒸馏的本质与未来

无论哪种形态,蒸馏的核心机制始终是teacher-student:用一个在特定维度上更强的信号,去密集指导另一个模型。

2026 年的实践告诉我们:

  • Teacher 不需要更大,只需要更专业在特定上下文中更好
  • On-policy 蒸馏能提供比 RL 更密集的 token-level 监督,显著降低训练成本。
  • Self-distillation 正在成为解决灾难性遗忘和持续学习的重要工具。

这些技术目前已经可以在 TRL(Transformers Reinforcement Learning)库中以可复现的规模实现。

我起初以为蒸馏只是模型压缩的工具,后来才发现它已经演变成合并专家能力、实现自我改进、甚至支持持续学习的通用机制。这可能是当前后训练阶段最被低估却最高效的杠杆之一。


你目前在做 post-training 时,主要遇到的是多领域能力融合的问题,还是持续学习/遗忘的问题?欢迎分享你的实践经验。

我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐