Kimi K3 重磅发布:2.8万亿参数开源模型,前端编程全球第一,正面硬刚 Claude 和 GPT

全球首个开源 3T 级大模型来了,前端编程直接登顶。门主连夜肝完资料,带你看看它到底有多能打。


一、为什么会写这篇

昨天凌晨,月之暗面发布了 Kimi K3。

说实话,看到参数规模的时候我愣了一下——2.8 万亿,全球首个开源 3T 级模型。

之前 Kimi K2 发布的时候,1 万亿参数已经让人惊叹了。这才过了不到一年,直接翻到了 2.8 万亿。

更让我意外的是,它在 Frontend Code Arena 前端编程榜单上直接干到了全球第一,把 Claude Fable 5 和 GPT-5.6 Sol 都压在了下面。

作为一个天天跟代码打交道的 Java 老炮,这种消息肯定是第一时间关注的。

于是我连夜把官方博客、技术报告、第三方评测翻了个遍,整理出这篇文章。

希望能帮你快速搞懂 Kimi K3 到底强在哪,跟 Claude、GPT 比到底差多少,以及它值不值得你上手。


二、Kimi K3 是什么

先看核心参数,一张表说清楚:

属性 数值
总参数量 2.8 万亿
每次激活参数 约 500 亿(16 / 896 个专家)
上下文窗口 100 万 token
架构 KDA 混合线性注意力 + 注意力残差
多模态 原生支持视觉理解(图文输入,文本输出)
默认思考模式 Max(极致模式),后续增加 Low/High
开源时间 2026 年 7 月 27 日前
发布版本 K3 Max(通用版)、K3 Swarm Max(并行版)

门主点评: 2.8 万亿参数,100 万上下文,开源。这三个关键词放在一起,冲击力确实不小。


三、架构解读:2.8 万亿参数是怎么驯服的

参数堆上去容易,但怎么让它真正干活,才是技术活。

K3 在架构上做了两个关键改进:

3.1 Kimi Delta Attention(KDA)

传统 Attention 的问题是:上下文越长,计算量呈平方级增长。100 万 token 下,每个 token 都要跟其他所有 token 交互,显存和延迟都扛不住。

KDA 的思路是:把长上下文拆成"已总结的历史"和"新来的变化"(Delta),历史部分用线性方式维护一个紧凑的记忆状态,新 token 只重点关注变化部分。

官方数据:百万 token 场景下,解码速度最高提升 6.3 倍

3.2 Attention Residuals(AttnRes)

模型层数越深,信息从底层传到顶层就越容易衰减。

AttnRes 在注意力机制上加了专门的残差连接,让每一层的输出可以更直接地跳过中间层,保留更原始的信息。

官方数据:训练效率提升约 25%,额外成本不到 2%

3.3 MoE 架构

896 个专家,每次只激活 16 个。

配合 Stable LatentMoE 框架、Quantile Balancing 和 Per-Head Muon 优化,K3 相比 K2 的整体扩展效率提升约 2.5 倍

输入 Token

Router 路由

共享专家

16/896 路由专家

KDA 混合线性注意力

Attention Residuals

输出

门主点评: KDA 解决长序列问题,AttnRes 解决深度问题,MoE 控制成本。三个组合拳打下来,2.8 万亿参数才能落地。


四、跑分对比:跟 Claude、GPT 正面硬刚

这是大家最关心的部分。

4.1 综合排名

在 Artificial Analysis Intelligence Index 上,K3 得分 57 分,排名第三:

排名 模型 得分
1 Claude Fable 5
2 GPT-5.6 Sol
3 Kimi K3 57
4 Claude Opus 4.8
5 GPT-5.5

官方也很坦诚:整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。

但拆到具体项目,情况就不一样了。

4.2 编程能力对比

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0

关键发现:

  • Program Bench:K3 77.8 分,超过 Fable 5 和 GPT-5.6 Sol
  • SWE Marathon(长会话编程):K3 42 分,比 Fable 5 高 7 分,比 GPT-5.6 Sol 高 3 分
  • Terminal Bench 2.1:K3 88.3 分,跟 GPT-5.6 Sol 的 88.8 分几乎持平
  • FrontierSWE:K3 81.2 分,超过 GPT-5.6 Sol 的 71.3 分,但低于 Fable 5 的 86.6 分

4.3 前端编程:全球第一

在 Frontend Code Arena 上,K3 以 1679 分 排名第一:

排名 模型 分数
🥇 Kimi K3 1679
🥈 Claude Fable 5 1631
🥉 GPT-5.6 Sol xHigh 1618

这个榜单是百万级用户参与的盲测,用户不知道自己在选哪个模型,结果可信度很高。

4.4 智能体与推理能力

基准测试 Kimi K3 Fable 5 GPT-5.6 Sol Opus 4.8
BrowseComp(长上下文检索) 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2
GPQA-Diamond 93.5 92.6 94.1 91.0
OmniDocBench(视觉文档) 91.1 89.8 85.8 87.9

门主点评: K3 不是全面碾压,而是"多点开花"。编程和 Agent 能力是第一梯队的,综合智能跟 Fable 5 和 GPT-5.6 Sol 还有差距,但已经超过了 Opus 4.8。


五、实际案例:它能干到什么程度

跑分是参考,实战才是硬道理。

案例 1:从零开发 GPU 编译器

K3 从零构建了一个叫 MiniTriton 的编译器,包含完整的 DSL 前端、MLIR 中间表示、优化 Pass 和 PTX 代码生成管线。

在部分工作负载上,性能达到甚至超过了官方 Triton 和 torch.compile,还能完成 nanoGPT 的端到端训练。

更离谱的是: K3 开发后期,一个早期版本的 K3 已经承担了团队大部分 GPU 内核优化工作。

案例 2:48 小时自主设计芯片

在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具独立完成了一颗 4mm² 芯片的设计、优化与验证,集成了 146 万个标准单元。

案例 3:两小时复现一周的科研工作

K3 用约 两小时 完成了通常需要资深研究员 一到两周 才能完成的工作:

  • 阅读并交叉验证 20 多篇论文
  • 评估 300 多种状态方程
  • 生成 3000 多行 Python 代码
  • 产出交互式分析仪表盘

门主点评: 跑分可以刷,但芯片设计和编译器开发这种真实任务做不了假。K3 的 Agent 长程执行能力确实到了一个新高度。


六、API 价格:贵不贵?

官方定价:

项目 价格(每百万 token)
输入(缓存命中) $0.30
输入(缓存未命中) $3.00
输出 $15.00

对比一下:

模型 输出价格(每百万 token)
Kimi K3 $15.00
Claude Fable 5 约 $75
Claude Opus 4.8 约 $37.50
GPT-5.6 Sol 约 $60
DeepSeek V4 Pro $0.50

K3 的输出价格是 Fable 5 的 20%,Opus 4.8 的 40%。

得益于 Mooncake 分离式推理架构,编程场景的缓存命中率可超过 90%,实际成本更低。

不过也要注意: K3 的定价比上一代 K2.6 涨了近 3 倍(K2.6 输出 $4/百万 token),更强的能力确实带来了更高的成本。


👇 三连支持,动力源泉

如果这篇文章帮你省下了踩坑的时间,欢迎:

🔹 点赞 —— 让更多人看到这篇干货
🔹 在看 —— 你的认可是我持续输出的动力
🔹 转发 —— 分享给身边正在做AI Agent的朋友

你的每一个小动作,对我都很重要 ❤️


🙏 关于作者

你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。

专注分享:

  • ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
  • ✅ RAG知识库、AI Agent、多智能体协作落地经验
  • ✅ Docker部署、微服务架构、线上问题排查
  • ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂

不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。

关注我,咱们一起少踩坑,多写优雅代码。


📖 更多干货推荐


🎁 粉丝福利

本文涉及的 完整源码 + 可运行Demo + 配置示例,已打包整理好。

免费获取方式
私信空门技术栈,领取源码包。

有任何问题,也欢迎后台私信,门主看到都会回复~

💬 对文章内容有疑问?想看下一篇写什么主题?

直接在评论区留言,你的每一条评论我都会看。说不定下一篇文章的主题,就来自你的问题!


🤝 项目合作 / 技术咨询

平时工作之余,也会接一些技术项目和咨询,主要方向:

⚔️ 企业级开发

  • Java / Spring Boot 项目开发与重构
  • 微服务架构设计与落地
  • 系统性能调优、线上问题排查

🤖 AI 应用落地(这是我最近的主力方向)

  • Spring AI Alibaba / RAG / Agent 应用开发
  • 企业私有知识库搭建
  • AI能力接入现有业务系统
  • 大模型本地化部署与调优

🛠️ 技术顾问 / 疑难Bug排查

  • 项目架构评审与方案设计
  • 线上疑难问题定位解决
  • 技术选型与团队培训

如果你正遇到以下情况,欢迎找我聊聊:

  • ✅ 想做AI项目,但技术方案拿不准
  • ✅ 项目卡在某个Bug上很久,团队搞不定
  • ✅ 想把AI接入现有业务,不知道从哪下手
  • ✅ 需要靠谱的开发外包或长期技术顾问

📮 联系渠道(按回复速度排序)

  1. 最快:私信空门技术栈
  2. 邮件:2929119150@qq.com(请注明来意和具体需求)

一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。

—— IT 空门,与诸君共修技术大道 😎

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐