蒸馏不再只是大模型教小模型:2026 前沿模型后训练的真实三阶段用法
在 2026 年的前沿模型后训练中,Distillation(蒸馏) 已经从一个辅助技巧变成了核心武器。
很多团队在做 post-training 时会遇到同一个痛点:用 RL(强化学习)让模型在多个领域变强非常困难。一个阶段学到的技能,在下一个阶段训练时很容易退化。想让一个模型同时在数学、代码、Agentic 任务上都优秀,传统 RL 路线成本极高且效果不稳定。
蒸馏提供了一种更高效、更灵活的解决方案。它不再只是“让大模型教小模型”,而是演化出了三种不同形态,正在被几乎所有前沿实验室广泛采用。
第一阶段:Off-Policy 蒸馏 —— 经典的大老师教小学生
这是最传统的用法:用一个大而贵的 teacher 模型,去训练一个更小的 student 模型,让它模仿 teacher 的行为。
Gemma 3 和 Gemma 4 的技术报告都明确提到 post-training 依赖改进版的知识蒸馏。DeepSeek-R1-Distill 则是把 R1 的 reasoning traces 通过普通 SFT(硬标签)蒸馏到 Qwen 和 Llama 等更小的模型上。
这个阶段有两种信号形式:
- 软标签(Soft labels):让 student 去匹配 teacher 的 next-token 概率分布(需要 white-box 访问)。
- 硬标签(Hard labels):直接用 teacher 生成的文本来训练 student(black-box 也可行)。
R1-Distill 采用的就是硬标签方式。核心思想没变,只是信号形式不同。
第二阶段:On-Policy 蒸馏 —— 多领域专家融合(2026 最主流的做法)
这是今年大多数前沿实验室真正收敛的用法。
当你想让一个模型同时擅长多个领域时,传统 RL 会导致前面学到的能力在后面被破坏。解决方案是:为每个领域单独训练一个 RL expert(数学 expert、代码 expert、Agentic expert),然后通过 on-policy 蒸馏把它们融合进一个统一的学生模型。
关键特点:
- Student 在生成 rollout(自己产生输出)的同时,多个 teacher 给出 token-level 的密集反馈。
- Teacher 往往不是更大的模型,而是同一个 base model 的不同 checkpoint,只是被 RL 在单一领域推得更远。专业化比规模更重要。
典型案例包括:
- DeepSeek-V4:明确描述了先为每个领域训练 expert(SFT + GRPO),再用 on-policy distillation 训练统一模型,使用 reverse KL loss。
- MOPD(Multi-Teacher On-Policy Distillation):多个 domain teacher 为 student 正在生成的 token 提供密集信号。
- GLM-5:在不同训练阶段之间做蒸馏,用早期 checkpoint 作为 teacher,恢复之前退化的能力。
- Nemotron 3 Ultra:用了超过 10 个 specialized teachers。
- Qwen3:经典的大 teacher + 小 student 方向,据称成本仅为 RL 的约 1/10,且效果更好。
为什么有效?RL 的 reward 是一个序列的单一标量,而蒸馏能对 student 生成的每一个 token 给出反馈,收敛更快、所需计算资源更少。
第三阶段:Self-Distillation —— 模型自己教自己
这是最有趣的形态:完全不需要额外的 teacher 模型。
Cursor Composer 2.5 采用了一种 clever 的方式:在训练时给模型注入一个描述期望行为的 hint,让带 hint 的模型成为 teacher,去教不带 hint 的同一个模型。通过 per-token KL divergence,拉近两者的策略。最终模型在推理时不需要 hint 也能表现出期望行为(privileged teacher)。
Thinking Machines 则用另一种 self-teacher 方式:在新领域数据上 fine-tune 后,用 fine-tune 之前的 checkpoint 作为 teacher,通过蒸馏恢复被破坏的原有能力,同时保留新学到的知识。这本质上是一种持续学习(continual learning) 的方案。
Self-distillation 的核心洞见是:teacher 不一定需要更大,只要在特定上下文中表现更好即可。有时候,那个更好的版本就是模型自己(不同状态下)。
三种蒸馏方式对比
| 阶段 | Teacher 来源 | 核心机制 | 主要用途 | 计算效率 | 典型代表 |
|---|---|---|---|---|---|
| Off-Policy | 更大/更强的独立模型 | 匹配 teacher 输出或分布 | 模型压缩 | 高 | Gemma、DeepSeek-R1-Distill |
| On-Policy | 同尺寸领域专家 checkpoint | Student 生成 + 多 teacher 打分 | 多领域能力融合 | 极高 | DeepSeek-V4、Nemotron 3、MOPD |
| Self-Distillation | 模型自身(带 hint / 早期 checkpoint) | 模型教自己 | 恢复能力 + 持续学习 | 最高 | Cursor Composer、Thinking Machines |
蒸馏的本质与未来
无论哪种形态,蒸馏的核心机制始终是teacher-student:用一个在特定维度上更强的信号,去密集指导另一个模型。
2026 年的实践告诉我们:
- Teacher 不需要更大,只需要更专业或在特定上下文中更好。
- On-policy 蒸馏能提供比 RL 更密集的 token-level 监督,显著降低训练成本。
- Self-distillation 正在成为解决灾难性遗忘和持续学习的重要工具。
这些技术目前已经可以在 TRL(Transformers Reinforcement Learning)库中以可复现的规模实现。
我起初以为蒸馏只是模型压缩的工具,后来才发现它已经演变成合并专家能力、实现自我改进、甚至支持持续学习的通用机制。这可能是当前后训练阶段最被低估却最高效的杠杆之一。
你目前在做 post-training 时,主要遇到的是多领域能力融合的问题,还是持续学习/遗忘的问题?欢迎分享你的实践经验。
我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。
更多推荐




所有评论(0)