Kimi K3!全球首个3万亿级开源模型王者
月之暗面今天放出了 Kimi K3,这个模型有2.8万亿参数,是全球首个开源的3万亿级别模型。
它在长程编程、知识工作和推理这些前沿场景里,整体实力接近最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。

但在 Frontend Code Arena 中,Kimi K3 以1679分超越 Claude Fable 5,位居第一。

其他部分基准测评上,也超越了 Claude Fable 5 和 GPT-5.6 Sol。


完成同样的任务,Token消耗费用远低于 Claude Fable 5 和 GPT-5.6 Sol,尤其在 BrowseComp 上。

超强长程编码
Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。它也擅长结合软件工程与视觉推理的任务,利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。
团队搭了一个内核优化竞技场,测试模型能否把 GPU 内核从头到尾优化好。每个模型在独立 GPU 沙箱里运行,任务、测试框架和生产负载完全一致。模型在最多24小时内分析现有实现、重写内核并反复跑分验证。

在最大思考强度下,Kimi K3 的表现接近 Fable-5(含回退机制),明显领先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。
团队进一步测试了模型从零构建 GPU 编程系统的能力。Kimi K3 开发了 MiniTriton,一款紧凑的类 Triton 编译器。它基于 MLIR 构建了自己的 tile 级中间表示层,实现了完整的优化 pass 到 PTX 代码生成流水线。在其支持的 Roofline 基准测试中,MiniTriton 的性能达到或超越 Triton 和 torch.compile,并在部分工作负载上优于 Triton。

结果证明它没有针对 benchmark 走捷径,也没有明显硬编码优化,MiniTriton 已经能生成有竞争力的 GPU 代码。作为端到端验证,团队用 TensorLite 训练了 nanoGPT,观察到正常收敛。Kimi K3 不只是生成几个孤立内核,它搭起了一套真正可用的编译器栈,包括编程抽象、中间表示、优化 pass、后端代码生成,以及接入真实训练负载的能力。
Kimi K3 还做了一颗芯片作为早期概念验证。这颗芯片用于运行一个基于自身架构构建的 nano 模型。在连续48小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了芯片的构建、优化与验证。

该芯片面积4 mm²,集成146万个标准单元、0.277 MB SRAM 以及带融合反量化的 INT4 MAC 阵列。它在 100 MHz 下完成时序收敛,仿真解码吞吐持续超过每秒8700个 token。一颗由模型设计、为模型服务的芯片,生动展现了 K3 的长程 Agent 能力。
Kimi K3 结合强大的编码能力、 3D 推理与视觉能力,可将概念、图像和视频转化为可交互体验数字作品。官方展示了下面 4 个 demo:
Kimi K3 推动了端到端知识工作的进展。在金融咨询和科研场景中展现了很强的能力。

Kimi Work 中的 K3 展示了强大的实力。例如,制作推理芯片行业研究。

报告覆盖 ASIC 行业42年历史,经过120多轮递归自我改进生成。K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。整个过程中,它完成了2800多次网页搜索与抓取、1100多次终端数据拉取,处理了87份季报和99份原始 PDF,合计超过11000页资料。
再比如,针对 GWTC-5 引力波分析,K3 进行了一次对391个引力波事件的分析。它使用20多个并发 subagents,产出7张科学可视化图、2张表格,综合了10多篇论文的文献内容。

在 Kimi Work 中,团队推出了小组件和看板两个新功能,让用户与 Kimi K3 的交互更加可视化,也更具持续性。
小组件可以在对话中直接生成交互式组件,连接本地数据或外部插件实现持续更新。看板把最关心的小组件汇总到一个长期保留的个性化视图中,围绕某个主题、项目或目标进行组织。
Kimi K3 还擅长动效设计、动画和视频剪辑,原生多模态架构可以在同一个模型中理解文字、图像和视频。
下面这个案例中,K3 制作了一支介绍自己架构的3Blue1Brown风格动态图形讲解视频,视频长达4分半的,把技术概念转化为动画图示和转场。
万亿参数新骨架
Kimi K3 基于 Kimi Delta Attention(KDA 混合线性注意力机制)和 Attention Residuals(注意力残差)构建。这两项架构更新让信息在更长序列和更深模型中流动得更顺畅。

KDA 为注意力扩展提供了高效基础。AttnRes 有选择地跨深度检索表示,避免在各层简单均匀累积。二者共同构成了 Kimi K3 的架构骨架,支撑模型扩展到万亿参数以上的规模。
模型进一步扩大了 Mixture of Experts(MoE 混合专家)的稀疏度。结合 Stable LatentMoE(稳定潜在混合专家)框架后,模型在896个专家中高效激活16个。
在这种稀疏度下,路由和优化成了关键挑战。Quantile Balancing(分位数平衡)直接根据路由分数的分位数分配专家,避免了启发式更新和敏感的平衡超参数。Per-Head Muon(基于注意力头的 Muon 优化)将 Muon 扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应。Sigmoid Tanh Unit(SiTU)和 Gated MLA(门控多头潜在注意力)分别增强激活控制和注意力选择性。这些改进共同支持了2.8万亿参数规模下稳定高效的训练。
训练方法和数据配方的优化加上这些结构性改进,让 Kimi K3 相比 K2 的整体扩展效率提升约2.5倍,更有效地把算力转化为能力。
训练基础设施也做了大量优化。Kimi K3 从 SFT(监督微调)阶段开始采用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以适配更广泛的硬件。
为避免在大规模专家并行中因专家负载不均影响吞吐,引入了完全均衡的专家并行训练方法。它使用静态形状,关键路径上不需要主机同步。推理效率同样受益于更大的高带宽通信域,团队建议在64个或更多加速器组成的 supernode(超级节点)配置上部署 Kimi K3。借助带 prefill cache 的 KDA,在大模型规模和长上下文条件下,也能以很有竞争力的 token 价格提供服务。
模型也存在一些局限性。它对历史思考内容敏感。在后训练过程中全程使用思考历史保留模式,当 agent 框架未按要求回传全部历史思考内容,或从其他模型正在进行的会话中切换到 Kimi K3 时,容易引发上下文干扰,导致内容生成质量不稳定。
官方建议使用 Kimi Code 等经过兼容性验证的 Agent 框架,避免在会话中途切换。
Kimi K3 的训练重点优化了长程高难任务。在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出非预期的决定。
如果希望 agent 更有边界感、不要过于自由发挥时,可以在 system prompt 或 AGENTS.md 中对 Kimi K3 施加更明确的行为约束。
现在,已经可通过 kimi.com、最新版 Kimi 手机App、最新版 Kimi Work 桌面客户端、Kimi Code 和 Kimi API,使用 Kimi K3 模型。
更多推荐


所有评论(0)