Kimi K3 深度测评(一):2.8万亿参数、1M上下文背后,它到底是"全能王"还是"偏科生"?

系列总览篇。本文不吹不黑,只做一件事:把 Kimi K3 的公开真实规格与基准数据摆上桌,再和 Claude Fable 5、GPT-5.6 Sol、DeepSeek V4 Pro 等一线模型正面对比,帮你判断它到底适合什么场景。

0. 一句话结论

Kimi K3 不是"全能通用王",而是当前开源阵营里最强的"长上下文 + 代码/智能体"特化模型:前端代码登顶、1M 上下文、agentic 长程任务强;但在专家级数学、研究级物理、以及事实幻觉控制上,明显落后于同代的 Claude / OpenAI 旗舰。

下面用数据说话。

一、先看清规格:它到底什么来头

Kimi K3 由月之暗面(Moonshot AI)于 2026 年 7 月 16 日托管上线,7 月 17 日在 WAIC 上海亮相,并承诺于 7 月 27 日放出完整权重(Modified MIT 许可证)。核心规格如下:

维度

数据

来源

参数规模

2.8 万亿总参数,稀疏 MoE,896 个专家,每 token 激活 16 个

Moonshot 官方

上下文窗口

1,048,576 tokens(1M)

Moonshot 官方

输入模态

文本 + 原生图像/视频理解

Moonshot 官方

推理模式

默认 "always-on thinking"(持续思考)

Moonshot 官方

架构创新

Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals + Stable LatentMoE + MXFP4/8 量化感知训练

Moonshot 技术报告(随权重发布)

API

模型 ID kimi-k3;OpenAI / Anthropic SDK 兼容;Base URL https://api.moonshot.ai/v1

Moonshot 官方

API 价格

3 / 百万非缓存输入,0.30 / 百万缓存输入,$15 / 百万输出

Moonshot 官方

自部署

vLLM / SGLang / TensorRT-LLM;需 A100 级 GPU 集群

Moonshot 官方

ARR

2026 年 6 月达 3 亿美元(4 月为 2 亿)

国内媒体 / 公司披露

⚠️ 注意:2.8T 是"总参数",不是"每 token 计算量"。稀疏 MoE 每 token 只激活 16/896 专家,所以它在"容量大"的同时,推理算力成本远低于同规模稠密模型——但权重存储、路由通信和 1M 上下文的内存压力依然巨大。

二、和谁比?真实智能指数横评

最干净的跨模型对比来自 Artificial Analysis Intelligence Index v4.1(同一套 harness、同一批设置测所有模型)。K3 得分约 57,是有史以来开源模型在该榜的最高排名

模型

智能指数(AA v4.1)

定位

Claude Fable 5

领先(榜首区间)

闭源旗舰

GPT-5.6 Sol

领先(榜首区间)

闭源旗舰

Kimi K3

≈57

开源第一,全球 3–4

Claude Opus 4.8

同档

闭源

GLM-5.2(智谱)

51

开源

Gemini 3.1 Pro Preview

46

闭源

DeepSeek V4 Pro

44

开源

结论:K3 把开源模型的天花板拉到了闭源旗舰的同一档位附近,但综合仍落后 Fable 5 / Sol 半个身位。

三、强在哪、弱在哪:一张表看懂"偏科"

能力

真实成绩

口径

评价

前端代码

LMArena Frontend Code Arena #1,Elo 1679(Fable5 1631 / Sol 1618)

人类盲评

🔴 强,首个登顶的中国模型

长上下文推理

AA-LCR 75%,被测最高

独立

🔴 强

信息检索

BrowseComp 91.2,SOTA

独立

🔴 强

研究生级科学

GPQA Diamond 94%(并列第一)

独立

🔴 强

Agentic 长程

AA-Briefcase #2(≈1527);AutomationBench-AA 53% #1;Harvey LAB-AA 95% #1

混合

🟡 偏强

通用对话

LMArena 文本榜 1486 Elo(一般)

人类盲评

🟡 中庸

终极推理

Humanity's Last Exam 44%(Fable5 53%)

独立

🟡 偏弱

研究级物理

CritPt 23%(中游)

独立

🟡 偏弱

专家级数学

FrontierMath Tier 4 ≈39%(西方顶尖≈90%)

Epoch AI

🔴 弱,差距超一倍

事实幻觉

AA-Omniscience 非幻觉率 49%(Opus4.8 64% / GLM5.2 72%)

独立

🔴 弱,且"答得越多错得越多"

把表竖着读:K3 在"写代码、读长文、跑流程、做科研级问答"上很能打;在"硬算数学、硬推物理、不胡说"上掉队明显。

四、我的判断与选型建议

  1. 适合:前端/全栈代码生成、超长文档(合同、论文、代码库)分析与检索、长程多步骤智能体(自动化办公、终端操作)、科研级 QA。
  1. 不适合:需要极高数学严谨性的场景(定理证明、金融量化建模、复杂数值仿真)、对"零幻觉"有硬要求的合规/医疗问答。
  1. 成本提醒:API 输出 $15/百万 token,比 DeepSeek V4 Pro、GLM-5.2 贵数倍。建议"重活上 K3,杂活上便宜模型"的混合路由。

📌 数据来源与实测说明(重要)

  • 本文基准数据来自 Moonshot 官方发布、Artificial Analysis、LMArena、Epoch AI 等公开渠道,为 2026 年 7 月下旬快照;基准排名每周变动,数字仅供参考。
  • ⚠️ 厂商自报的编码分数混合了 KimiCode / Claude Code / Codex / mini-SWE-agent 等不同 harness,并非严格同口径,不同 harness 可造成 10–26 分波动,请谨慎看待。
  • 本系列后续文章提供可一键运行的测试脚本,读者可自行跑出真实输出验证。
  • 投资/选型有风险,本文不构成任何商业或投资建议。
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐