最近模型圈有个特别有意思的现象。

智谱 GLM-5.2 开源了,Code Arena 全球第二、Design Arena 全球第一,FrontierSWE 干到 74.4 分,跟 Claude Opus 4.8 的 75.1 只差 0.7 个百分点。MIT 协议,成本是闭源模型的六分之一。

然后是月之暗面 Kimi K3,2.8 万亿参数,Frontend Code Arena 直接干到第一,1679 分超过 Claude Fable 5。SWE Marathon 长程编程 42 分,也是第一。

两个国产模型前后脚,一个比一个猛。

然后你去社群、评论区逛一圈,总能看到同一种言论:

"嗨,不就是用中转站 API 蒸馏了国外模型嘛。"

"你看这回答风格、这代码质量,跟 GPT/Claude 一模一样,不是蒸馏是什么?"

"国产模型哪有这水平,肯定是数据偷偷喂了外国货。"

有意思的是,这种说法不是第一次出现了。

DeepSeek 爆火的时候有,Qwen 变强的时候有,现在 GLM 和 Kimi 冲上来了,又有了。好像国产模型只要一接近国际第一梯队,默认的解释就是"偷了"。

这篇文章不想写"辟谣体"——"我没有、你别乱说、我们是自研的",那太低级了。

我想认认真真聊三个问题:

第一,知识蒸馏到底是什么?它能让一个 700B 参数的模型凭空长出超越教师的能力吗? 很多人嘴里的"蒸馏"和真实的蒸馏,根本不是一回事。

第二,国产模型最近的爆发,真实的技术路径是什么? 智谱的 IndexShare、月之暗面的 KDA,这些东西不是"换个皮",而是实打实的架构创新。

第三,为什么"蒸馏论"永远有市场? 这背后其实是一种很有意思的认知偏差,和整个行业信息差造成的误解。

读完这篇,你再听到有人说"肯定是蒸馏的",就知道该怎么判断了。

一、先把概念掰扯清楚:你说的"蒸馏",和真实的蒸馏,可能不是一回事

很多人对"蒸馏"的想象大概是这样的:找一个强大的外国模型(比如 GPT-5 或 Claude Opus),通过 API 大量提问,把它的回答存下来,然后拿去训练自己的模型——"抄作业"嘛,谁不会?

这个想象只对了三分之一。

知识蒸馏(Knowledge Distillation)确实是用一个"教师模型"的输出来训练"学生模型",但它的能力边界和很多人想的完全不一样。

1.1 蒸馏的本质是"能力压缩",不是"能力超越"

蒸馏最经典的应用场景是什么?是把大模型的能力压缩到小模型里

比如 GPT-4 有上万亿参数,部署太贵。你用 GPT-4 生成一批高质量问答对,拿去训练一个 7B 的小模型,让小模型在特定任务上接近大模型的效果,但推理成本只有几十分之一。

这才是蒸馏的标准用法:老师 > 学生,蒸馏是降维打击的逆向工程

那能不能反过来?用一个小老师教出一个大学生?

理论上也可以,但效果上限基本就是老师的水平,甚至会打折。你让一个小学老师去教大学生,教得再认真,学生的天花板也高不到哪去。

这就引出了"蒸馏论"的第一个逻辑硬伤:

如果 GLM-5.2 和 Kimi K3 真的是蒸馏 Claude 或 GPT 的产物,那它们怎么可能在某些 benchmark 上超过教师模型?

Kimi K3 在 SWE Marathon 上拿了 42 分,超过 Claude Opus 4.8 的 40 分和 Fable 5 的 35 分。GLM-5.2 在 MCP-Atlas 工具调用评测上 76.8 分,超过 GPT-5.5 的 75.3 分。来源:掘金《GLM-5.2 实战上手》 来源:ZAKER新闻《月之暗面发布 Kimi K3》

学生考得比老师还好,这蒸馏是怎么做到的?难不成还带"基因变异"的?

1.2 后训练 ≠ 蒸馏,别把什么都往一个筐里装

很多人混淆了一个重要概念:后训练(Post-training)和知识蒸馏不是一回事。

现代大模型的训练流程大致分三步:

表格

阶段 目标 数据量 算力占比
预训练 学知识、学逻辑、学语言 万亿 token 级 ~95%
监督微调(SFT) 学会听指令、按格式输出 十万~百万级 ~2%
偏好对齐(RLHF/DPO) 学会判断好坏、符合人类价值观 十万级偏好对 ~3%

知识蒸馏是什么位置?它通常是后训练阶段的一种可选技术——用强模型生成的数据来补充 SFT 或 RLHF 的训练数据。

注意关键词:补充

蒸馏数据可以让模型的回答更"像"教师模型的风格,可以提升某些任务的表现,但它替代不了基座的预训练,也决定不了模型的能力上限。

打个比方:预训练是把一个孩子从幼儿园读到大学毕业,学了一肚子知识。SFT 和 RLHF 是教他怎么面试、怎么跟人打交道、怎么把肚子里的货表达出来。

蒸馏就相当于——找了个金牌讲师,给他补了几节面试技巧课。

补完课之后,他面试表现确实会更好。但你要说"这个人之所以厉害,全靠那几节面试课",就有点扯了。他肚子里得先有货,面试技巧才能派上用场。

这也是为什么业内有一句共识:预训练决定能力的上限,后训练决定你能把上限发挥出多少。

一个 700B 参数、经过万亿 token 预训练的基座模型,如果底子不行,你再怎么蒸馏也变不成 Opus。反过来,如果基座本身就够强,后训练做好了,逼近甚至局部超越闭源旗舰,完全是合理的。

1.3 "API中转站蒸馏"的技术可行性,其实很低

再说说那个最流行的说法:"通过 API 中转,用 GPT/Claude 的回答来训练国产模型。"

这个说法听起来很有画面感,但从技术角度看,有几个过不去的坎:

第一,数据量不够。

预训练阶段的数据量是万亿 token 级别。通过 API 抓取?先不说成本,就说速度——假设你每秒能抓 1000 个 token,一天就是 8600 万,一年也才 300 多亿。离万亿级差着数量级。

而且 API 输出的质量分布极不均匀,大量是重复的、低质量的。要从中筛选出高质量、多样化、覆盖全面的训练数据,难度极大。

第二,能力分布不匹配。

API 调用的输入输出是有偏的——大家都问什么?写代码、写文案、翻译、解答知识题。这些数据训练出来的模型,在常见任务上可能表现不错,但遇到冷门领域、复杂推理、长链任务,立马露馅。

但 GLM-5.2 和 Kimi K3 的强,恰恰体现在那些"偏门"的地方:长上下文的中间 recall、跨文件代码重构、多工具编排、反事实推理。

这些能力,是 API 蒸馏不出来的——因为你根本不知道该问什么问题来覆盖这些维度。

第三,架构差异对不上。

这是最硬核的一条反驳。

GLM-5.2 用的是自回归+填空的混合预训练范式(GLM 系列的标志性特征),配合自研的 IndexShare 稀疏注意力和 DSA 深度稀疏注意力机制。来源:CSDN《GLM-5.2大模型技术深度介绍》

Kimi K3 更夸张,用的是自研 KDA 混合线性注意力(Kimi Delta Attention),把长上下文的解码速度提升了 6.3 倍,还有 Attention Residuals 注意力残差技术。来源:新浪财经《月之暗面旗舰模型Kimi K3》

这些架构层面的创新,直接决定了模型的能力特征——比如 GLM 的长上下文稳定性、Kimi 的解码速度。

蒸馏只能模仿输出分布,模仿不了架构特性。一个用普通 Transformer 架构的模型,再怎么蒸馏也不可能凭空长出 KDA 线性注意力的能力。就像你再怎么抄学霸的作业,也抄不来他的脑回路。

二、别光盯着"是不是抄的",国产模型的真实技术路径更值得聊

说句实在话,"蒸馏论"之所以有市场,很大程度上是因为大家对国产模型的技术进展了解太少。

很多人的认知还停留在"国产模型 = 用开源底座 + 中文数据微调"的阶段。但实际上,智谱、月之暗面这些团队,已经在架构层面做了不少真东西。

2.1 智谱 GLM-5.2:不只是"更大了",而是"更高效了"

很多人看到 GLM-5.2 的第一反应是:"744B 参数,堆料嘛。"

但堆料谁不会?真正难的是——堆到 744B 还能跑得动、还能便宜、还能在长上下文上不翻车。

GLM-5.2 有两个技术点很有代表性:

IndexShare 索引共享机制。

传统的稀疏注意力,每一层都要单独构建位置索引和注意力计算矩阵。到了百万 token 级别,这个开销随层数线性增长,最后算力都花在"建索引"上了。

智谱的做法是:每四层稀疏注意力层共用一个轻量化索引器。听起来简单,对吧?但效果是——百万 token 输入下,单位 token 的 FLOPs 降到原来的 1/2.9,推理算力成本直接压缩 65% 以上。来源:4sapi Blog《GLM-5.2: Open-Source Coding LLM Explained》

这不是"抄"来的。这是工程团队在处理长上下文时,实打实遇到了瓶颈,然后想出来的优化方案。

MTP 多令牌预测解码升级。

简单说就是投机解码(Speculative Decoding)的升级版——用一个轻量草稿模型一次生成多个候选 token,然后主模型一次性验证。GLM-5.2 把单次有效接受长度提升了 20%,长代码生成速度提升 30% 以上。

这两个东西,一个管长上下文推理成本,一个管生成速度。合在一起,才让"百万 token 上下文"从纸面参数变成了真能用的工程能力。

你说这是蒸馏能蒸出来的?Claude Opus 的架构里连 MoE 都不是,它蒸什么?

2.2 月之暗面 Kimi K3:从"堆参数"到"重构注意力"

如果说智谱的路线是"在 MoE 上做精细优化",那月之暗面走得更远——他们直接改了注意力机制。

KDA(Kimi Delta Attention)混合线性注意力。

传统 Transformer 的注意力是 O(N²) 复杂度的——输入越长,计算量平方级增长。这也是为什么很多模型"号称"百万上下文,但实际用起来又慢又贵的原因。

KDA 把注意力拆成了两部分:一部分是线性复杂度的"底噪注意力",处理远距离的一般关联;另一部分是标准注意力,聚焦关键位置的强关联。合在一起,在保证效果的前提下,把长上下文解码速度提升了 6.3 倍。来源:智趣探新科《Kimi K3大模型发布》

这不是什么玄学,这是线性注意力(Linear Attention)方向的工程化落地。学术界在这个方向研究了好几年,但真正做到产品级可用、还能支撑 2.8 万亿参数规模的,全球范围内也没几家。

还有 Attention Residuals(注意力残差) 。深层网络有个老问题——信息传着传着就衰减了,到了后面几层,前面的内容已经模糊了。AttnRes 的做法是让深层网络可以跨层"调取"浅层的原始注意力信息,训练效率提升约 25%,长周期任务的逻辑稳定性明显变好。

再加上 Stable LatentMoE——896 个专家、每次激活 16 个,还有 Quantile Balancing 分位数平衡的路由策略。这套组合拳打下来,K3 的整体扩展效率比上代 K2 提升了 2.5 倍。

2.8 万亿参数,还能保持不错的推理效率,还能开源。这背后是一整套自研的技术栈,从编译器(Mini Triton)到推理框架(Mooncake 分离式架构)再到底层注意力机制,全是自己的东西。

你跟我说这是"蒸馏国外模型"?那国外模型怎么没蒸馏出一个 KDA 来?

2.3 一个更重要的事实:国产模型已经形成了差异化的技术路线

把智谱和月之暗面放在一起看,你会发现一个很有意思的现象——它们走的路并不一样。

智谱是 "MoE + 稀疏注意力优化"路线:在经典 Transformer 框架下,通过 MoE 扩大参数量,再用 IndexShare、DSA 等技术把长上下文的成本打下来。优势是工程成熟、稳定性好,与现有推理框架(vLLM、SGLang)兼容性高。

月之暗面是 "线性注意力 + 超大规模 MoE"路线:直接从注意力机制层面动刀,用 KDA 突破 O(N²) 瓶颈,然后把参数堆到 2.8 万亿——反正注意力是线性的,参数量再大也扛得住。

两条路线,各有取舍,各有擅长的场景。

智谱更适合企业级落地——兼容性好、成本低、MIT 协议完全开放。

月之暗面更适合前沿探索——架构更新颖、长上下文效率更高、多模态原生集成。

这说明什么?说明国产大模型已经过了"跟着别人屁股后面跑"的阶段了,开始有自己的技术判断和路线选择了。

如果都是"蒸馏国外模型",那大家的架构应该趋同才对——毕竟抄作业嘛,抄的是同一份答案。但现实是,各家的技术路线越来越分化,越来越有自己的特色。

这不是抄作业的样子,这是开始独立解题的样子。

三、为什么"蒸馏论"永远有人信?

聊完技术,我们聊点更有意思的:为什么这种说法每隔一段时间就要冒出来一次,而且每次都有人信?

我觉得至少有三层原因。

3.1 第一层:行业信息差——大模型训练是个黑箱

大模型训练这事,说穿了就是"数据 + 算力 + 算法"三件套。但具体怎么配比、什么数据、什么训练策略、什么后训练流程——这些都是各家的核心机密,不会公开。

Anthropic 不会告诉你 Claude Opus 是怎么训出来的,OpenAI 也不会。智谱和月之暗面同样不会——能告诉你架构创新,已经算是诚意满满了。

信息一不对称,人们就倾向于用自己能理解的方式去解释。

"蒸馏"这个概念简单、形象、人人都能懂——不就是抄作业嘛。于是它就成了默认的"标准答案"。

这跟以前人们觉得"芯片就是沙子做的,有什么难的"是一个路数。理解不了的东西,就往最简单的解释上靠。

3.2 第二层:认知偏差——"国产 = 不行"的思维定式

这个就比较扎心了,但得实话实说。

过去几十年,我们在很多高科技领域确实是追赶者。从芯片到操作系统,从航空发动机到高端医疗器械——很长一段时间里,"国外领先、国产追赶"是常态。

这种长期积累的认知惯性,不是一两个模型就能扭转的。

所以当国产模型突然冲到世界第一梯队,很多人的第一反应不是"哇,我们也做到了",而是"这肯定有水分"。

叫"幸存者偏差"也好,叫"崇洋媚外"也罢,本质上都是思维定式跟不上现实变化的速度

但你想想看:过去十年,移动互联网我们反超了吧?电商、支付、短视频,哪个不是中国玩家领跑?新能源汽车,我们现在是全球最大的生产国和出口国。光伏、风电、动力电池——这些领域的全球龙头基本都是中国企业。

大模型这个赛道,中国本来就是全球第二极。算力、数据、人才,哪一样缺了?凭什么就不能冲到第一梯队?

3.3 第三层:心理学的"确认偏误"——人只愿意相信自己愿意相信的

确认偏误(Confirmation Bias)是说:人一旦形成了某种观点,就会主动寻找支持自己观点的证据,而忽略反面证据。

如果你心里已经预设了"国产模型是蒸馏的",那你会自动收集所有"证据":

  • "你看它写代码的风格跟 Claude 好像"——废话,写对了的代码风格本来就差不多
  • "你看它回答的套路跟 GPT 一模一样"——高质量回答的结构本来就有共通性
  • "你看它也会犯同样的错误"——大模型的错误模式本来就有共性

但你不会去想:

  • 为什么它在某些 benchmark 上超过了"老师"?
  • 为什么它的架构和"老师"不一样?
  • 为什么它的长上下文能力比"老师"还强?

这些反证会被自动过滤掉。

这不是谁的错,这是人类大脑的工作方式。我们都有这个毛病,包括我自己。

但至少,知道有这么个偏差存在,可以帮助我们在下次脱口而出"肯定是蒸馏的"之前,多停一秒——等一下,有没有可能不是?

四、真正该讨论的问题,从来不是"是不是抄的"

说来说去,"蒸馏论"其实是个挺没意思的话题。

因为它的讨论路径注定是死胡同:你说我是蒸馏的,我说我不是;你拿不出我是蒸馏的证据,我也拿不出我完全没用到蒸馏数据的证据——这事没法证伪。

但行业里真正重要的问题,被这个口水话题给掩盖了。

4.1 问题一:开源模型逼近闭源旗舰,行业格局会怎么变?

一年前,开源模型和闭源模型之间还有代差。大家的共识是:开源追得再快,跟 GPT、Claude 之间永远隔着一堵墙。

现在呢?

GLM-5.2 综合能力 51 分,跟 Opus 4.8 的 56 分、GPT-5.5 的 55 分,已经是同一个数量级了。来源:CSDN《Code Arena全球第二,开源第一》

Kimi K3 直接冲到 57 分,全球第三。来源:新浪财经《月之暗面旗舰模型Kimi K3》

而且这俩都是开源的。MIT 协议,随便用,随便改,随便商用。

这意味着什么?

意味着闭源模型的护城河正在被快速填平。以前你想用最顶级的模型,只能找 OpenAI 或 Anthropic 买 API。现在你可以下载一个开源模型,自己部署,自己微调,自己控制数据安全,成本还低得多。

企业的选择多了,议价权强了。闭源厂商的定价权会被削弱,它们必须拿出真正的差异化价值——比如多模态、工具生态、安全性——才能维持溢价。

这是整个行业格局的变化,比"是不是蒸馏的"重要一万倍。

4.2 问题二:后训练才是真正的战场

前面说了,预训练决定上限,后训练决定你能发挥出多少。

现在开源模型的基座能力已经很强了,但不同厂商做出来的产品体验,差距还是很大。为什么?因为后训练的水太深了。

SFT 数据怎么配比?RLHF 的奖励模型怎么训?DPO 和 GRPO 怎么结合?推理模型的强化学习怎么做?这些都是各家的核心机密。

同样一个基座模型,你自己瞎训一通,可能训废了。人家高手来训,效果能提升 30%。

这才是真正拉开差距的地方。

而且,后训练能力是可以快速迭代的——基座模型半年更一次就不错了,但后训练策略可以每周调、每月更。谁的后训练工程能力强,谁就能在同样的基座上做出更好的产品体验。

与其纠结"基座是不是抄的",不如关注一下各家在后训练上都在搞什么新东西。那才是未来一两年真正的竞争焦点。

4.3 问题三:中国大模型的下一步,该往哪走?

这个问题更宏大,但也更值得思考。

现在的情况是:基座能力已经逼近国际第一梯队了,甚至在某些细分方向(长上下文、编程、Agent)已经领先了。然后呢?

是继续堆参数、卷跑分,还是换个赛道?

从最近的动向来看,各家的选择不太一样:

  • 智谱在深耕工程化落地——开源、低价、国产芯片适配,把最强的能力以最低的成本给到开发者。说白了就是"普惠"。
  • 月之暗面在探索前沿边界——2.8 万亿参数、自研注意力、原生多模态、Agent 能力,不断往上探天花板。
  • 深度求索(DeepSeek)在走推理 + 数学的路线,GRPO、R1 推理模型,在纯推理赛道上深耕。
  • 阿里通义千问在做全栈布局——从手机端小模型到旗舰大模型,从通用到垂类,什么都有。

百花齐放,这是好事。

最怕的是什么?是大家都挤在同一条赛道上内卷,比谁参数大、比谁跑分高,然后把真正的创新机会给挤没了。

好消息是,目前看来没有。各家的技术路线、产品定位、目标市场,都在逐渐分化。这是一个行业走向成熟的标志。

结尾:自信一点,没坏处

写到这,我想起一个事儿。

前阵子有个朋友跟我说,他用 GLM-5.2 写了一段时间代码,觉得跟 Claude 差不多,甚至某些场景更好用。但他心里总有个疙瘩:"会不会是我心理作用?国产模型真的有这么强吗?"

你看,连亲自用过、觉得好用的人,都还在自我怀疑。

这就是"蒸馏论"最隐蔽的危害——它不是伤害了哪家公司,而是潜移默化地削弱了我们对自己技术能力的信心

好像只要是国产的、好用的,就一定有猫腻。好像我们就天生该比别人差。

但事实是:

  • 中国有全球最大的互联网市场,有最多的应用场景,有最丰富的数据;
  • 中国有全球最多的 AI 论文产出,有一流的科研人才;
  • 中国有完整的产业链配套,从芯片到框架到应用,全链路都有玩家。

在这样的基础上,跑出几个世界级的大模型公司,不是很正常的事吗?

当然,我不是说国产模型已经全面超越了。差距还是有的——在最顶尖的复杂推理、在多模态的深度融合、在 Agent 的长程稳定性上,闭源旗舰依然有优势。

但差距正在快速缩小,而且是肉眼可见地缩小。

这不值得骄傲吗?这不值得兴奋吗?

下次再听到有人说"国产模型都是蒸馏的",你可以笑着回一句:

"蒸馏能蒸出 IndexShare?能蒸出 KDA?能蒸出 2.8 万亿参数的开源模型?"

"要不,你蒸一个试试?"

参考来源

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐