月之暗面今天放出了 Kimi K3,这个模型有2.8万亿参数,是全球首个开源的3万亿级别模型。

它在长程编程、知识工作和推理这些前沿场景里,整体实力接近最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。

图片

但在 Frontend Code Arena 中,Kimi K3 以1679分超越 Claude Fable 5,位居第一。

图片

其他部分基准测评上,也超越了 Claude Fable 5 和 GPT-5.6 Sol。

图片

图片

完成同样的任务,Token消耗费用远低于  Claude Fable 5 和 GPT-5.6 Sol,尤其在 BrowseComp 上。

图片

超强长程编码

Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。它也擅长结合软件工程与视觉推理的任务,利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。

团队搭了一个内核优化竞技场,测试模型能否把 GPU 内核从头到尾优化好。每个模型在独立 GPU 沙箱里运行,任务、测试框架和生产负载完全一致。模型在最多24小时内分析现有实现、重写内核并反复跑分验证。

图片

在最大思考强度下,Kimi K3 的表现接近 Fable-5(含回退机制),明显领先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。

团队进一步测试了模型从零构建 GPU 编程系统的能力。Kimi K3 开发了 MiniTriton,一款紧凑的类 Triton 编译器。它基于 MLIR 构建了自己的 tile 级中间表示层,实现了完整的优化 pass 到 PTX 代码生成流水线。在其支持的 Roofline 基准测试中,MiniTriton 的性能达到或超越 Triton 和 torch.compile,并在部分工作负载上优于 Triton。

图片

结果证明它没有针对 benchmark 走捷径,也没有明显硬编码优化,MiniTriton 已经能生成有竞争力的 GPU 代码。作为端到端验证,团队用 TensorLite 训练了 nanoGPT,观察到正常收敛。Kimi K3 不只是生成几个孤立内核,它搭起了一套真正可用的编译器栈,包括编程抽象、中间表示、优化 pass、后端代码生成,以及接入真实训练负载的能力。

Kimi K3 还做了一颗芯片作为早期概念验证。这颗芯片用于运行一个基于自身架构构建的 nano 模型。在连续48小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了芯片的构建、优化与验证。

图片

该芯片面积4 mm²,集成146万个标准单元、0.277 MB SRAM 以及带融合反量化的 INT4 MAC 阵列。它在 100 MHz 下完成时序收敛,仿真解码吞吐持续超过每秒8700个 token。一颗由模型设计、为模型服务的芯片,生动展现了 K3 的长程 Agent 能力。

Kimi K3 结合强大的编码能力、 3D 推理与视觉能力,可将概念、图像和视频转化为可交互体验数字作品。官方展示了下面 4 个 demo:

Kimi K3 推动了端到端知识工作的进展。在金融咨询和科研场景中展现了很强的能力。

图片

Kimi Work 中的 K3 展示了强大的实力。例如,制作推理芯片行业研究。

图片

报告覆盖 ASIC 行业42年历史,经过120多轮递归自我改进生成。K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。整个过程中,它完成了2800多次网页搜索与抓取、1100多次终端数据拉取,处理了87份季报和99份原始 PDF,合计超过11000页资料。

再比如,针对 GWTC-5 引力波分析,K3 进行了一次对391个引力波事件的分析。它使用20多个并发 subagents,产出7张科学可视化图、2张表格,综合了10多篇论文的文献内容。

图片

在 Kimi Work 中,团队推出了小组件和看板两个新功能,让用户与 Kimi K3 的交互更加可视化,也更具持续性。

小组件可以在对话中直接生成交互式组件,连接本地数据或外部插件实现持续更新。看板把最关心的小组件汇总到一个长期保留的个性化视图中,围绕某个主题、项目或目标进行组织。

Kimi K3 还擅长动效设计、动画和视频剪辑,原生多模态架构可以在同一个模型中理解文字、图像和视频。

下面这个案例中,K3 制作了一支介绍自己架构的3Blue1Brown风格动态图形讲解视频,视频长达4分半的,把技术概念转化为动画图示和转场。

万亿参数新骨架

Kimi K3 基于 Kimi Delta Attention(KDA 混合线性注意力机制)和 Attention Residuals(注意力残差)构建。这两项架构更新让信息在更长序列和更深模型中流动得更顺畅。

图片

KDA 为注意力扩展提供了高效基础。AttnRes 有选择地跨深度检索表示,避免在各层简单均匀累积。二者共同构成了 Kimi K3 的架构骨架,支撑模型扩展到万亿参数以上的规模。

模型进一步扩大了 Mixture of Experts(MoE 混合专家)的稀疏度。结合 Stable LatentMoE(稳定潜在混合专家)框架后,模型在896个专家中高效激活16个。

在这种稀疏度下,路由和优化成了关键挑战。Quantile Balancing(分位数平衡)直接根据路由分数的分位数分配专家,避免了启发式更新和敏感的平衡超参数。Per-Head Muon(基于注意力头的 Muon 优化)将 Muon 扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应。Sigmoid Tanh Unit(SiTU)和 Gated MLA(门控多头潜在注意力)分别增强激活控制和注意力选择性。这些改进共同支持了2.8万亿参数规模下稳定高效的训练。

训练方法和数据配方的优化加上这些结构性改进,让 Kimi K3 相比 K2 的整体扩展效率提升约2.5倍,更有效地把算力转化为能力。

训练基础设施也做了大量优化。Kimi K3 从 SFT(监督微调)阶段开始采用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以适配更广泛的硬件。

为避免在大规模专家并行中因专家负载不均影响吞吐,引入了完全均衡的专家并行训练方法。它使用静态形状,关键路径上不需要主机同步。推理效率同样受益于更大的高带宽通信域,团队建议在64个或更多加速器组成的 supernode(超级节点)配置上部署 Kimi K3。借助带 prefill cache 的 KDA,在大模型规模和长上下文条件下,也能以很有竞争力的 token 价格提供服务。

模型也存在一些局限性。它对历史思考内容敏感。在后训练过程中全程使用思考历史保留模式,当 agent 框架未按要求回传全部历史思考内容,或从其他模型正在进行的会话中切换到 Kimi K3 时,容易引发上下文干扰,导致内容生成质量不稳定。

官方建议使用 Kimi Code 等经过兼容性验证的 Agent 框架,避免在会话中途切换。

Kimi K3 的训练重点优化了长程高难任务。在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出非预期的决定。

如果希望 agent 更有边界感、不要过于自由发挥时,可以在 system prompt 或 AGENTS.md 中对 Kimi K3 施加更明确的行为约束。

现在,已经可通过 kimi.com、最新版 Kimi 手机App、最新版 Kimi Work 桌面客户端、Kimi Code 和 Kimi API,使用 Kimi K3 模型。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐