Kimi K3 深度测评(一):2.8万亿参数、1M上下文背后,它到底是“全能王“还是“偏科生“?
Kimi K3 深度测评(一):2.8万亿参数、1M上下文背后,它到底是"全能王"还是"偏科生"?

系列总览篇。本文不吹不黑,只做一件事:把 Kimi K3 的公开真实规格与基准数据摆上桌,再和 Claude Fable 5、GPT-5.6 Sol、DeepSeek V4 Pro 等一线模型正面对比,帮你判断它到底适合什么场景。
0. 一句话结论
Kimi K3 不是"全能通用王",而是当前开源阵营里最强的"长上下文 + 代码/智能体"特化模型:前端代码登顶、1M 上下文、agentic 长程任务强;但在专家级数学、研究级物理、以及事实幻觉控制上,明显落后于同代的 Claude / OpenAI 旗舰。
下面用数据说话。
一、先看清规格:它到底什么来头
Kimi K3 由月之暗面(Moonshot AI)于 2026 年 7 月 16 日托管上线,7 月 17 日在 WAIC 上海亮相,并承诺于 7 月 27 日放出完整权重(Modified MIT 许可证)。核心规格如下:
|
维度 |
数据 |
来源 |
|
参数规模 |
2.8 万亿总参数,稀疏 MoE,896 个专家,每 token 激活 16 个 |
Moonshot 官方 |
|
上下文窗口 |
1,048,576 tokens(1M) |
Moonshot 官方 |
|
输入模态 |
文本 + 原生图像/视频理解 |
Moonshot 官方 |
|
推理模式 |
默认 "always-on thinking"(持续思考) |
Moonshot 官方 |
|
架构创新 |
Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals + Stable LatentMoE + MXFP4/8 量化感知训练 |
Moonshot 技术报告(随权重发布) |
|
API |
模型 ID |
Moonshot 官方 |
|
API 价格 |
|
Moonshot 官方 |
|
自部署 |
vLLM / SGLang / TensorRT-LLM;需 A100 级 GPU 集群 |
Moonshot 官方 |
|
ARR |
2026 年 6 月达 3 亿美元(4 月为 2 亿) |
国内媒体 / 公司披露 |
⚠️ 注意:2.8T 是"总参数",不是"每 token 计算量"。稀疏 MoE 每 token 只激活 16/896 专家,所以它在"容量大"的同时,推理算力成本远低于同规模稠密模型——但权重存储、路由通信和 1M 上下文的内存压力依然巨大。
二、和谁比?真实智能指数横评
最干净的跨模型对比来自 Artificial Analysis Intelligence Index v4.1(同一套 harness、同一批设置测所有模型)。K3 得分约 57,是有史以来开源模型在该榜的最高排名。
|
模型 |
智能指数(AA v4.1) |
定位 |
|
Claude Fable 5 |
领先(榜首区间) |
闭源旗舰 |
|
GPT-5.6 Sol |
领先(榜首区间) |
闭源旗舰 |
|
Kimi K3 |
≈57 |
开源第一,全球 3–4 |
|
Claude Opus 4.8 |
同档 |
闭源 |
|
GLM-5.2(智谱) |
51 |
开源 |
|
Gemini 3.1 Pro Preview |
46 |
闭源 |
|
DeepSeek V4 Pro |
44 |
开源 |
结论:K3 把开源模型的天花板拉到了闭源旗舰的同一档位附近,但综合仍落后 Fable 5 / Sol 半个身位。
三、强在哪、弱在哪:一张表看懂"偏科"
|
能力 |
真实成绩 |
口径 |
评价 |
|
前端代码 |
LMArena Frontend Code Arena #1,Elo 1679(Fable5 1631 / Sol 1618) |
人类盲评 |
🔴 强,首个登顶的中国模型 |
|
长上下文推理 |
AA-LCR 75%,被测最高 |
独立 |
🔴 强 |
|
信息检索 |
BrowseComp 91.2,SOTA |
独立 |
🔴 强 |
|
研究生级科学 |
GPQA Diamond 94%(并列第一) |
独立 |
🔴 强 |
|
Agentic 长程 |
AA-Briefcase #2(≈1527);AutomationBench-AA 53% #1;Harvey LAB-AA 95% #1 |
混合 |
🟡 偏强 |
|
通用对话 |
LMArena 文本榜 1486 Elo(一般) |
人类盲评 |
🟡 中庸 |
|
终极推理 |
Humanity's Last Exam 44%(Fable5 53%) |
独立 |
🟡 偏弱 |
|
研究级物理 |
CritPt 23%(中游) |
独立 |
🟡 偏弱 |
|
专家级数学 |
FrontierMath Tier 4 ≈39%(西方顶尖≈90%) |
Epoch AI |
🔴 弱,差距超一倍 |
|
事实幻觉 |
AA-Omniscience 非幻觉率 49%(Opus4.8 64% / GLM5.2 72%) |
独立 |
🔴 弱,且"答得越多错得越多" |
把表竖着读:K3 在"写代码、读长文、跑流程、做科研级问答"上很能打;在"硬算数学、硬推物理、不胡说"上掉队明显。
四、我的判断与选型建议
- 适合:前端/全栈代码生成、超长文档(合同、论文、代码库)分析与检索、长程多步骤智能体(自动化办公、终端操作)、科研级 QA。
- 不适合:需要极高数学严谨性的场景(定理证明、金融量化建模、复杂数值仿真)、对"零幻觉"有硬要求的合规/医疗问答。
- 成本提醒:API 输出 $15/百万 token,比 DeepSeek V4 Pro、GLM-5.2 贵数倍。建议"重活上 K3,杂活上便宜模型"的混合路由。
📌 数据来源与实测说明(重要)
- 本文基准数据来自 Moonshot 官方发布、Artificial Analysis、LMArena、Epoch AI 等公开渠道,为 2026 年 7 月下旬快照;基准排名每周变动,数字仅供参考。
- ⚠️ 厂商自报的编码分数混合了 KimiCode / Claude Code / Codex / mini-SWE-agent 等不同 harness,并非严格同口径,不同 harness 可造成 10–26 分波动,请谨慎看待。
- 本系列后续文章提供可一键运行的测试脚本,读者可自行跑出真实输出验证。
- 投资/选型有风险,本文不构成任何商业或投资建议。
更多推荐



所有评论(0)