一、国内模型常 “蒸馏” 的国外模型,以及行业现状

模型蒸馏本身是中性的通用技术,分两类玩法:

  • 合规开源蒸馏:用开源大模型当 “老师” 训练自己的小模型,完全合法,是行业常规操作(上一篇文章讲过了);
  • 灰色 API 蒸馏:批量调用其它闭源商业模型的 API、抄它的输出训练自己的模型,违反对应厂商的服务协议,也是圈内常聊的 “扒能力、套壳式蒸馏”。

1. 最主流的两类蒸馏目标

(1)闭源模型:圈内八卦里的经常被 “抄” 对象

表格

目标模型 地位 为什么被拿来蒸馏
GPT(OpenAI) 行业第一大 “公共教师” 能力最均衡、API 最成熟,早期国内绝大多数中小模型、垂类模型,都用它批量生成的问答数据做微调。缺点是 OpenAI 管控越来越严,批量调用容易封号,且拿不到内部思考过程,只能抄最终答案
Claude 系列(Anthropic) 长文本 / 推理场景热门目标 长上下文能力强,容易诱导出完整思维链(推理过程),相当于连 “解题草稿” 都能抄到,蒸馏出来的模型推理能力更像原版
GPT-4o 等多模态模型 多模态赛道常用目标 图文理解能力强,很多国内小厂的多模态小模型,都是批量扒它的图文回答来快速训练
(2)合规开源基座:正规军的通用玩法

完全合法的主流操作,国内绝大多数开源模型都这么做:

  • Llama 2/3 系列(Meta):国内大部分开源大模型的基础底座,很多模型是在 Llama 上做中文优化、知识蒸馏,属于行业通用做法。
  • Mistral 系列:小尺寸效果好,常用来做端侧小模型、轻量化模型的蒸馏老师。

2. 国内厂商的大致情况

  • 头部大厂(名字就不列了):主力模型都是从零做完整预训练、自有对齐技术栈,不会依赖蒸馏国外闭源模型。一来体量大藏不住,二来靠蒸馏永远只能跟在别人后面,没法做技术突破。
  • 中小创业公司、垂类小模型:早期普遍靠 GPT/Claude 的 API 数据快速起量,用最低成本快速做出一个 “能用” 的模型,是行业公开的潜规则。
  • 开源社区模型:基本都基于 Llama 等开源基座做二次蒸馏 / 微调,合规透明。

二、这类“抄能力”(模型蒸馏)到底是怎么干的

模型蒸馏本质就是 「学霸带学渣,抄学霸的思路考高分」。能力强、体积大、运行贵的大模型叫「老师模型」,要训练的低成本小模型叫「学生模型」。蒸馏的目标,就是让便宜小巧的学生模型,答题效果尽量接近昂贵的老师模型。

版本 A:最常见的 “扒模型”——API 蒸馏(4 步走)

这是最简单粗暴、中小厂最爱用的方式,全程不用拿到对方的代码和权重,只要能调用 API 就行。

  1. 出一套海量考卷

先准备几十万到上千万道 “题目”,覆盖聊天、写作、编程、数学、逻辑、常识等所有场景。题可以自己攒,也可以爬公开数据集,甚至让模型自己生成。

  1. 让学霸挨个做题,连草稿纸一起抄

批量调用 GPT/Claude 的 API,把题目一道一道扔进去,让学霸给出完整答案。

  • 普通玩法:只抄最终答案,属于低配抄作业;
  • 高级玩法(比如圈内提到的Claude 漏洞,拿思维链CoT):想办法诱导学霸把 ** 完整思考过程(思维链 CoT)** 也吐出来,连 “学霸心里怎么一步步推导的” 都抄下来,效果直接翻倍。
  1. 喂给学生,让它照着模仿

把 “题目 + 答案 + 思考过程” 整理成标准训练数据,喂给自己的学生模型做监督微调(SFT),反复训练,让学生记住:遇到这类题,就按这个思路、这个语气回答。

  1. 查漏补缺,反复迭代

针对学生答不好的难题,再去学霸那里多抄几遍同类题,针对性补课,直到普通用户用起来,手感和老师模型差不多。

为什么 Claude 比 GPT 更容易被 “蒸透”?普通 GPT 你只能抄到最终答案,相当于学霸只给你最终结果;而 Claude 能被诱导出完整思维链,相当于连学霸的草稿纸、解题步骤全给你了,学生学起来更快、更像本尊,推理能力还原度更高。

版本 B:学术正统的知识蒸馏(更高级,但闭源模型用不了)

正规的知识蒸馏不是抄答案,是抄 **「老师的判断倾向」**。比如一道选择题,老师不是只告诉你 “选 C”,而是告诉你:A 可信度 10%,B20%,C60%,D10%—— 这种带概率的 “软答案”,能让学生学到老师的判断逻辑,而不是死记硬背答案。

但这种操作需要拿到模型内部的输出概率,只有开源模型才能做;GPT、Claude 这种闭源模型拿不到,所以只能退而求其次抄最终答案,属于低配版蒸馏。

三、蒸馏模型有什么问题或短板

  • 上限永远超不过老师,只能无限接近,还容易抄到老师的偏见、幻觉等坏习惯;
  • 本质是 “模仿答题”,没有扎实的底层知识底座,遇到完全超纲的新题很容易露馅;
  • 这也是有追求的头部大厂不屑于纯靠蒸馏的原因:永远只能跟在别人后面,没法自己迭代突破。

那大家为什么都爱做蒸馏?

  • 成本极低:从零训练一个大模型要几亿几十亿,蒸馏一个能用的模型可能几十万几百万就搞定;
  • 见效极快:几个星期就能做出效果不错的模型,快速上线抢占市场;
  • 对中小厂来说,是 “用最低成本跟上第一梯队能力” 的捷径

现在也能理解,刚刚前段时间Claude和国内某个大厂的恩怨了。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐