Kimi K3 重磅发布:2.8万亿参数开源模型,前端编程全球第一,正面硬刚 Claude 和 GPT
Kimi K3 重磅发布:2.8万亿参数开源模型,前端编程全球第一,正面硬刚 Claude 和 GPT
全球首个开源 3T 级大模型来了,前端编程直接登顶。门主连夜肝完资料,带你看看它到底有多能打。
一、为什么会写这篇
昨天凌晨,月之暗面发布了 Kimi K3。
说实话,看到参数规模的时候我愣了一下——2.8 万亿,全球首个开源 3T 级模型。
之前 Kimi K2 发布的时候,1 万亿参数已经让人惊叹了。这才过了不到一年,直接翻到了 2.8 万亿。
更让我意外的是,它在 Frontend Code Arena 前端编程榜单上直接干到了全球第一,把 Claude Fable 5 和 GPT-5.6 Sol 都压在了下面。
作为一个天天跟代码打交道的 Java 老炮,这种消息肯定是第一时间关注的。
于是我连夜把官方博客、技术报告、第三方评测翻了个遍,整理出这篇文章。
希望能帮你快速搞懂 Kimi K3 到底强在哪,跟 Claude、GPT 比到底差多少,以及它值不值得你上手。
二、Kimi K3 是什么
先看核心参数,一张表说清楚:
| 属性 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿 |
| 每次激活参数 | 约 500 亿(16 / 896 个专家) |
| 上下文窗口 | 100 万 token |
| 架构 | KDA 混合线性注意力 + 注意力残差 |
| 多模态 | 原生支持视觉理解(图文输入,文本输出) |
| 默认思考模式 | Max(极致模式),后续增加 Low/High |
| 开源时间 | 2026 年 7 月 27 日前 |
| 发布版本 | K3 Max(通用版)、K3 Swarm Max(并行版) |
门主点评: 2.8 万亿参数,100 万上下文,开源。这三个关键词放在一起,冲击力确实不小。
三、架构解读:2.8 万亿参数是怎么驯服的
参数堆上去容易,但怎么让它真正干活,才是技术活。
K3 在架构上做了两个关键改进:
3.1 Kimi Delta Attention(KDA)
传统 Attention 的问题是:上下文越长,计算量呈平方级增长。100 万 token 下,每个 token 都要跟其他所有 token 交互,显存和延迟都扛不住。
KDA 的思路是:把长上下文拆成"已总结的历史"和"新来的变化"(Delta),历史部分用线性方式维护一个紧凑的记忆状态,新 token 只重点关注变化部分。
官方数据:百万 token 场景下,解码速度最高提升 6.3 倍。
3.2 Attention Residuals(AttnRes)
模型层数越深,信息从底层传到顶层就越容易衰减。
AttnRes 在注意力机制上加了专门的残差连接,让每一层的输出可以更直接地跳过中间层,保留更原始的信息。
官方数据:训练效率提升约 25%,额外成本不到 2%。
3.3 MoE 架构
896 个专家,每次只激活 16 个。
配合 Stable LatentMoE 框架、Quantile Balancing 和 Per-Head Muon 优化,K3 相比 K2 的整体扩展效率提升约 2.5 倍。
门主点评: KDA 解决长序列问题,AttnRes 解决深度问题,MoE 控制成本。三个组合拳打下来,2.8 万亿参数才能落地。
四、跑分对比:跟 Claude、GPT 正面硬刚
这是大家最关心的部分。
4.1 综合排名
在 Artificial Analysis Intelligence Index 上,K3 得分 57 分,排名第三:
| 排名 | 模型 | 得分 |
|---|---|---|
| 1 | Claude Fable 5 | — |
| 2 | GPT-5.6 Sol | — |
| 3 | Kimi K3 | 57 |
| 4 | Claude Opus 4.8 | — |
| 5 | GPT-5.5 | — |
官方也很坦诚:整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。
但拆到具体项目,情况就不一样了。
4.2 编程能力对比
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
关键发现:
- Program Bench:K3 77.8 分,超过 Fable 5 和 GPT-5.6 Sol
- SWE Marathon(长会话编程):K3 42 分,比 Fable 5 高 7 分,比 GPT-5.6 Sol 高 3 分
- Terminal Bench 2.1:K3 88.3 分,跟 GPT-5.6 Sol 的 88.8 分几乎持平
- FrontierSWE:K3 81.2 分,超过 GPT-5.6 Sol 的 71.3 分,但低于 Fable 5 的 86.6 分
4.3 前端编程:全球第一
在 Frontend Code Arena 上,K3 以 1679 分 排名第一:
| 排名 | 模型 | 分数 |
|---|---|---|
| 🥇 | Kimi K3 | 1679 |
| 🥈 | Claude Fable 5 | 1631 |
| 🥉 | GPT-5.6 Sol xHigh | 1618 |
这个榜单是百万级用户参与的盲测,用户不知道自己在选哪个模型,结果可信度很高。
4.4 智能体与推理能力
| 基准测试 | Kimi K3 | Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| BrowseComp(长上下文检索) | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| OmniDocBench(视觉文档) | 91.1 | 89.8 | 85.8 | 87.9 |
门主点评: K3 不是全面碾压,而是"多点开花"。编程和 Agent 能力是第一梯队的,综合智能跟 Fable 5 和 GPT-5.6 Sol 还有差距,但已经超过了 Opus 4.8。
五、实际案例:它能干到什么程度
跑分是参考,实战才是硬道理。
案例 1:从零开发 GPU 编译器
K3 从零构建了一个叫 MiniTriton 的编译器,包含完整的 DSL 前端、MLIR 中间表示、优化 Pass 和 PTX 代码生成管线。
在部分工作负载上,性能达到甚至超过了官方 Triton 和 torch.compile,还能完成 nanoGPT 的端到端训练。
更离谱的是: K3 开发后期,一个早期版本的 K3 已经承担了团队大部分 GPU 内核优化工作。
案例 2:48 小时自主设计芯片
在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具独立完成了一颗 4mm² 芯片的设计、优化与验证,集成了 146 万个标准单元。
案例 3:两小时复现一周的科研工作
K3 用约 两小时 完成了通常需要资深研究员 一到两周 才能完成的工作:
- 阅读并交叉验证 20 多篇论文
- 评估 300 多种状态方程
- 生成 3000 多行 Python 代码
- 产出交互式分析仪表盘
门主点评: 跑分可以刷,但芯片设计和编译器开发这种真实任务做不了假。K3 的 Agent 长程执行能力确实到了一个新高度。
六、API 价格:贵不贵?
官方定价:
| 项目 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出 | $15.00 |
对比一下:
| 模型 | 输出价格(每百万 token) |
|---|---|
| Kimi K3 | $15.00 |
| Claude Fable 5 | 约 $75 |
| Claude Opus 4.8 | 约 $37.50 |
| GPT-5.6 Sol | 约 $60 |
| DeepSeek V4 Pro | $0.50 |
K3 的输出价格是 Fable 5 的 20%,Opus 4.8 的 40%。
得益于 Mooncake 分离式推理架构,编程场景的缓存命中率可超过 90%,实际成本更低。
不过也要注意: K3 的定价比上一代 K2.6 涨了近 3 倍(K2.6 输出 $4/百万 token),更强的能力确实带来了更高的成本。
👇 三连支持,动力源泉
如果这篇文章帮你省下了踩坑的时间,欢迎:
🔹 点赞 —— 让更多人看到这篇干货
🔹 在看 —— 你的认可是我持续输出的动力
🔹 转发 —— 分享给身边正在做AI Agent的朋友
你的每一个小动作,对我都很重要 ❤️
🙏 关于作者
你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。
专注分享:
- ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
- ✅ RAG知识库、AI Agent、多智能体协作落地经验
- ✅ Docker部署、微服务架构、线上问题排查
- ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂
不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。
关注我,咱们一起少踩坑,多写优雅代码。
📖 更多干货推荐
- 告别手动复制接口文档!Apifox MCP + AI 自动测试让开发效率起飞
- MySQL MCP Server 从零安装到使用实战,AI 直接查询数据库
- Spring Event 用了三年,同事一句话把我问懵了
- Java 抽象类(Abstract Class)彻底讲透:从基础到多态实战
- Spring AI Alibaba 多智能体(Multi-agent)实战:6 大协作模式 + 完整代码
- Spring AI Alibaba 智能体作为工具实战:别再让主 Agent 当"人肉路由器"了
- 一文搞懂 Spring AI Alibaba Workflow:10 个实战案例带你彻底掌握 AI 工作流编排
- AI 工程进入第四时代!Loop Engineering 正在淘汰 Prompt Engineering
- RAG 知识库为什么越更新越乱?一文讲透生产级文档更新方案
- GPT-5.6 三档模型:Sol、Terra、Luna 怎么选?一篇文章讲透
- Transformers VS vLLM:大模型部署到底该选谁?从本地运行到生产上线完整解析
🎁 粉丝福利
本文涉及的 完整源码 + 可运行Demo + 配置示例,已打包整理好。
免费获取方式:
私信空门技术栈,领取源码包。
有任何问题,也欢迎后台私信,门主看到都会回复~
💬 对文章内容有疑问?想看下一篇写什么主题?
直接在评论区留言,你的每一条评论我都会看。说不定下一篇文章的主题,就来自你的问题!
🤝 项目合作 / 技术咨询
平时工作之余,也会接一些技术项目和咨询,主要方向:
⚔️ 企业级开发
- Java / Spring Boot 项目开发与重构
- 微服务架构设计与落地
- 系统性能调优、线上问题排查
🤖 AI 应用落地(这是我最近的主力方向)
- Spring AI Alibaba / RAG / Agent 应用开发
- 企业私有知识库搭建
- AI能力接入现有业务系统
- 大模型本地化部署与调优
🛠️ 技术顾问 / 疑难Bug排查
- 项目架构评审与方案设计
- 线上疑难问题定位解决
- 技术选型与团队培训
如果你正遇到以下情况,欢迎找我聊聊:
- ✅ 想做AI项目,但技术方案拿不准
- ✅ 项目卡在某个Bug上很久,团队搞不定
- ✅ 想把AI接入现有业务,不知道从哪下手
- ✅ 需要靠谱的开发外包或长期技术顾问
📮 联系渠道(按回复速度排序):
- 最快:私信空门技术栈
- 邮件:2929119150@qq.com(请注明来意和具体需求)
一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。
—— IT 空门,与诸君共修技术大道 😎
更多推荐



所有评论(0)