Kimi K3 正式开源!

图片

完整权重放到 Hugging Face 上,1小时内就登上趋势榜第一。

图片

全球第一个开源的3万亿参数级别模型,编程和Agent能力逼近 Claude Fable 5 和 GPT-5.6 Sol,而推理成本只有后者的几分之一。发布即震惊硅谷,惊呼为下一个DeepSeek时刻。

图片

甚至导致美国开始考虑封禁中国开源模型。黄仁勋、马斯克等一众全球大佬力挺开源。

图片

英伟达甚至与37家科技巨头建立开放安全AI联盟。

图片

Kimi K3 权重刚刚发布,全球光速 Day 0 适配。

图片

图片

图片

图片

图片

图片

这是属于开源 AI 与中国 AI 的荣光。

与 Kimi K3 一同开源的,还有关键 Infra 基础设施层技术。

为超大细粒度 MoE 打造的高性能通信库MoonEP,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。

Kimi Delta Attention 高性能算子(kernel)FlashKDA。在英伟达 H20 上,相比 flash-linear-attention 基线,它的 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。

月之暗面与KVCache.ai合作开发的沙箱系统AgentENV,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的 Agent 工作流与训练任务。

技术报告也一同发布。

图片

Kimi K3 是一个 2.8T(万亿)参数的 MoE(混合专家)模型,每个 token 激活 104B(百亿)参数,原生支持视觉理解,上下文窗口拉到 100 万 token。

依靠 KDA(Kimi Delta Attention,Kimi 增量注意力)、AttnRes(Attention Residuals,注意力残差)、Stable LatentMoE(稳定潜在混合专家)这套架构组合拳,加上 MoonEP 等基建创新,它比 Kimi K2 的规模化效率高出约 2.5 倍。

后训练阶段,团队在通用推理、通用 Agent、编程 Agent 三大领域做了大规模强化学习,训练轨迹动辄上百万 token、数千次工具调用。

评测结果显示,Kimi K3 在编程、搜索、知识工作等任务上全面领先其他开源和闭源模型,仅落后于 Claude Fable 5 和 GPT-5.6 Sol 两家。

三条信息高速公路

Kimi K3 的架构围绕三个维度做信息流动:序列长度、网络深度、模型宽度。

图片

序列长度方向,每个 block 里放 3 层 KDA 加 1 层 Gated MLA(门控多头潜在注意力),比例 3:1。KDA 是一种线性注意力,用固定大小的循环状态替代了传统 softmax 注意力不断增长的 KV cache,处理长序列时内存开销恒定。Gated MLA 则保留全局 token 间交互能力,两者互补。

K3 所有 MLA 层不用任何位置编码(NoPE),位置信息完全由 KDA 的循环门控和衰减机制隐式编码,扩展到 100 万 token 时不需要重新调 RoPE 频率或做 YaRN 插值。

深度方向,AttnRes 让每一层可以选择性地从所有前序层中取信息,而非传统残差连接那样只做逐层累加。具体做法是每层学一个伪查询,对所有前层输出做 softmax 注意力加权。

为了控制内存,实际采用 Block AttnRes:把 93 层分成 8 个 block,block 间做全注意力,block 内做累加,内存开销从 O(Ld) 降到 O(Nd)。

宽度方向,Stable LatentMoE 把路由专家池扩到 896 个,每个 token 激活 16 个,稀疏度 56 倍。共享专家保持全宽度处理通用变换,路由专家在压缩的潜在空间(宽度 3584,是隐藏维度的一半)里做专门化计算。

Stable LatentMoE 要解决两个极端稀疏下的训练难题。

一是激活爆炸:路由路径连续经过下投影、专家前馈、上投影,将近 4 次矩阵乘法串联,2.8 万亿参数规模下内部激活容易炸。团队在专家聚合和上投影之间插入 RMSNorm,并把 SwiGLU 替换为自研的 SiTU-GLU(Sigmoid Tanh Unit GLU,Sigmoid 双曲正切单元门控线性单元)。SiTU-GLU 用 β·tanh(x/β) 做软截断,在原点附近近似线性,大值时有界,兼顾了 SwiGLU 的局部响应和数值稳定性。

图片

二是负载均衡:896 个专家的负载平衡远超传统辅助损失方法的适用范围。团队提出 Quantile Balancing(分位数平衡),从路由器分数的分位数直接推导每个专家的偏置,使每个专家恰好接收目标数量的 token。

图片

视觉部分,MoonViT-V2 是一个 27 层、约 4 亿参数的视觉 Transformer,完全从零开始用 next-token prediction(下一token预测)训练,没有用 SigLIP 等对比学习模型做初始化。对比预训练的编码器接入 LLM 后联合优化不稳定,梯度范数持续偏高且频繁出现尖峰。

从零训练的 MoonViT-V2 全程梯度平稳,最终在视觉评测上追平了 SigLIP 初始化基线。

图片

图像和视频共享参数,注意力分解为帧内空间和帧间时间两个通道,2×2 像素重采样把视觉 token 数压缩 4 倍,3584×3584 像素的输入也能装进 100 万 token 上下文。

优化器用 Per-Head Muon,对 Q、K、V 投影矩阵的动量按头维度切分,逐头做 Newton-Schulz 正交化,避免大梯度头主导更新方向,训练更稳定。

从8K到100万token

预训练数据覆盖 Web 文本、代码、数学、知识四大文本领域,加上大规模视觉语料。知识类和数学类数据做了多样化风格和视角的改写。视觉数据大幅扩展了程序化多模态内容,把代码片段和渲染结果配对,涵盖 SVG、3D 资产、网页、游戏、CAD 图纸等格式。

Scaling law 实验确认,架构、数据、训练方法的改进合计带来约 2.5 倍的规模化效率提升。学习率调度用 cosine decay(余弦衰减),团队在独立超参搜索下对比了 WSD(Warmup Stable Decay,预热稳定衰减),cosine decay 在各自最优超参下始终取得更低最终损失。

图片

上下文长度通过4阶段课程逐步扩展,预训练阶段从 8K 到 64K,cooldown(冷却)阶段从 256K 到 1M。长文档和视频经过专门清洗管线处理,还合成了跨 100 万 token 的拼接任务,确保注意力机制在目标尺度上真正学会远距离依赖。

后训练分3步走。

SFT(监督微调)阶段建立冷启动策略,用前代 Kimi 模型合成复杂 Agent 轨迹数据,经多阶段验证和人工标注。所有数据用自研的 XTML(eXtensible Token Markup Language,可扩展标记语言)聊天模板序列化。从 SFT 阶段起就引入 QAT(量化感知训练),专家权重用 MXFP4,激活用 MXFP8。

RL(强化学习)阶段在3个领域训练:通用任务(推理、视觉、搜索、知识工作)、通用 Agent(长程助手、深度研究、写作)、编程 Agent(软件工程、kernel 优化、Web 开发)。每个领域再分 low、high、max 三档推理力度,共产出 9 个专家模型。

RL 算法采用 partial rollout(部分展开),不必等所有轨迹跑完,一部分完成就开始策略优化,暂停的轨迹排入下一轮优先恢复。长轨迹天然跨越多个迭代轮次,算法通过逐 token 正则化容忍极端 off-policy(离策略)数据。

推理力度控制用 per-problem budget,给每个问题估一个初始 token 预算,超出阈值倍数的轨迹直接判负。先训 max 档,再逐步收紧预算得到 high 和 low 档。

MOPD(Multi-Teacher On-Policy Distillation,多教师在策略蒸馏)把 9 个专家的能力合并进一个统一模型。训练时根据领域和推理力度选择对应教师,用逐 token 的对数概率比做密集奖励信号,裁剪极端优势值以稳定训练。

任务合成方面,团队构建了一个自演化的层次知识图谱,Agent 持续通过网络搜索扩展节点,从粗粒度领域到细粒度概念。

图片

采样节点组合成关键词,检索公开材料,再由合成 Agent 生成各类训练任务。RL 环境涵盖可验证搜索、专业知识工作、软件工程、kernel 优化、多模态视觉推理、个人助手(模拟 Gmail、Notion、Slack 等应用的持久化环境)、自主执行任务、Web 开发等。单个 rollout 可能涉及数千次工具调用和数百万 token 上下文。

让3万亿参数跑起来

2.8T 参数、混合注意力、100 万 token Agent 轨迹,三个系统级难题同时出现。

KDA 的系统协同设计分3层。训练和 prefill(预填充)用 FlashKDA,一个 CUTLASS 实现的 chunkwise kernel,把 chunk 内并行计算和跨 chunk 状态传播重叠执行。长上下文 prefill 用设备内 context parallelism(上下文并行),把序列切分到单卡 SM 上并行计算各段状态转移再合并。

跨设备用 KDA Context Parallelism(KCP)。KDA 的 delta rule 使每段效果依赖进入该段的状态,不能像普通线性注意力那样直接求和。KCP 把每段分解为累积转移矩阵和从零生成的局部状态两个量,通过一次 all-gather 交换固定大小的张量,再用前缀扫描恢复各 rank 的输入状态,通信量恒定。

预训练基建用 PP(流水线并行)+ VP(虚拟阶段)+ EP(专家并行)+ ZeRO-1 数据并行 + Pipeline ZeRO-2 梯度分片 + CP 的组合。

MoonEP 实现完美负载均衡的专家并行。每个 rank 恰好接收 S×K 个 token,计算形状静态已知,消除了逐层 host 同步。团队证明 E/R 个冗余专家即可保证平衡方案始终存在(E 为专家数,R 为 EP 大小),在线规划用 GPU kernel 近似最优求解,零拷贝通信把 token 直接送到远端专家分组位置。

内存方面,统一激活管理器支持重计算、FP8 量化、offload 到 CPU 或远程 PP rank 的自由组合。MoE 反向传播通过数学变换消除对前向输出的依赖。AttnRes 的 block 表示在边界层生成一次后共享,配合 checkpointing 使每层激活存储与标准残差架构相同。

100 万 token Agent RL 基建采用 co-located(同置)训练,partial rollout 减少尾延迟。外部 KV cache 池把空闲前缀写回 CPU DRAM,KDA 状态与 MLA KV cache 生命周期对齐。auto-throttling 调度器根据运行时信号动态控制并发。沙箱用 AgentENV,基于 Firecracker microVM,支持增量检查点(133ms)和恢复(49ms),暂停时零资源占用,fork 可做无副作用的奖励评判。整个训练和评测期间共创建了 51,219,741 个沙箱。

推理服务方面,KDA-aware prefix cache 把 KDA 循环状态和 MLA KV cache 统一管理在同一个分页池中。前缀哈希在 512 token 细粒度 hash block 上运行,KDA 检查点只在稀疏边界保存,查找分两阶段:MLA 阶段匹配物理块再回退到块内 hash 端点,KDA 阶段要求所有 cache group 在该边界都有检查点。命中后可从任意 512 token 边界恢复 prefill,无需重算前缀。

舰队级调度用 cache-aware affinity(缓存感知亲和)把会话路由到持有其前缀缓存的集群,consistent hashing 分配主备集群。budget-based admission control(基于预算的准入控制)给不同请求类别分配独立资源预算,防止长上下文突发流量拖垮短请求的 TTFT(首token时间)。

成绩单

评测覆盖推理与知识、编程、Agent、视觉四大类,对比 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5 和 GLM-5.2。所有模型用最大推理力度。

图片

Kimi K3 在编程、Agent、视觉等基准上,多数任务仅次于 Claude Fable 5 和 GPT-5.6 Sol,全面领先其他模型。

图片

与闭源及开源模型的性能对比。

编程方面,ProgramBench 77.8% 全场最高。SWE-Marathon(GPU kernel 导向)42.0%,领先 Claude Fable 5 整整 7 个百分点。FrontierSWE 81.2% 排第二,仅次于 Claude Fable 5 的 86.6%,大幅领先其他所有模型。

Agent 方面,BrowseComp 91.2% 全场第一,DeepSearchQA F1 95.0% 全场第一,MCPMark-Verified 94.5% 全场第一,AutomationBench 30.8% 全场第一。GDPval-AA v2 Elo 1686 排第三,落后 Claude Fable 5(1747)和 GPT-5.6 Sol(1736)。

视觉方面,OmniDocBench 91.1% 全场最高,Math-Vision 加 Python 工具后 97.8%,ZeroBench 加工具后 41.0% 与 Claude Fable 5 并列第一。

第三方评测同样印证了这些结论。

图片

截至2026年7月23日,Kimi K3 在 WebDev Arena 排名第一,是首个登顶该榜单的开源模型。

成本效率方面,Kimi K3 在4个基准上均处于或接近成本效率前沿。

图片

Kimi Code Bench 2.0 上,Kimi K3 以 Claude Fable 5 约 38% 的成本取得仅低 4 分的成绩。BrowseComp 上,91.2% 的最高分对应每任务 2.03 美元,是 GPT-5.6 Sol 的一半,比 Claude 系列便宜一个数量级。GDPval-AA v2 上,Kimi K3 比 GPT-5.6 Sol 便宜 13%,比 Claude Fable 5 便宜 2.6 倍。

案例研究展示了 Kimi K3 的实际能力边界。

GPU kernel 优化任务中,Kimi K3 在 24 小时预算内把 AttnRes 延迟从 283.6ms 降到 114.4ms(提速 59.7%),KDA 运行时间削减 73.6%,表现与 Claude Fable 5 持平,大幅超过 GPT-5.6 Sol(+17.3%)和 GPT-5.5(+30.8%)。

图片

团队还让 Kimi K3 从零开发了 MiniTriton,一个类 Triton 的 GPU 编译器,含 Python 前端、MLIR 优化层、PTX 代码生成,在 NVIDIA L20 上核心基准几何均值超过 PyTorch eager 和 torch.compile,tensor-core matmul 达到 cuBLAS 约 90% 的机器峰值。

芯片设计方面,Kimi K3 在 48 小时自主运行中完成了一个推理芯片原型的 RTL 设计、优化和验证,100MHz 下解码吞吐超过 8700 token/s。

网络安全评测中,Kimi K3 在漏洞发现层面从数十个广泛部署系统中识别出数百个候选漏洞,人工审核确认率约 70%,包括 16 个此前未知的漏洞(涉及 Linux 内核远程堆越界写入和 RDMA 子系统本地提权)。端到端漏洞利用套件(36 题)上解决 14 题(38.9%),GLM-5.2 解决 8 题(22.2%)。英国 AI 安全研究所和 NIST CAISI 的独立联合评估结论一致。

Kimi K3 的整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol。在研究级推理(CritPt、HLE-Full)差距明显,计算机使用类任务(OSWorld 2.0、SaaS-Bench)也还有空间。

但作为第一个开源的 3T 级模型,它把前沿智能的门槛拉到了每个人都能触及的位置。

参考资料:

https://github.com/MoonshotAI/Kimi-K3

https://huggingface.co/moonshotai/Kimi-K3

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐