7月17日,月之暗面正式发布Kimi3。TokenStar(tokenstar.world)作为首批上线的聚合平台,几乎同步开放了Kimi3的API接入。我们第一时间拿到了调用权限,用一个整天的时间,把Kimi3和它上代K2.6、以及GPT-5.4、DeepSeek V4做了一个全面对比。

以下所有测试数据均通过TokenStar统一API调用获得——这确保了硬件环境、网络延迟、调用参数的一致性。

先说核心结论:Kimi3不是"K2.6的小改款",是一次真正的代际升级

如果你期待Kimi3只是在K2.6的基础上"参数多了一点、速度快了一点",那你看到对比结果会和我一样意外。Kimi3在推理、数学、代码、指令遵循四个维度上有质的飞跃,上下文管理效率也明显优化——同等长度的文档,Kimi3的处理时间比K2.6缩短了约30%。

最让我意外的是Kimi3在短文本场景上的提升。Kimi一直以来的标签是"长文档王者",短文本不是它的主场。但Kimi3在短文本问答上的表现已经逼近GPT-5.4和DeepSeek V4——这意味着Kimi3从"长文专家"进化成了"全能选手"。

八个维度逐项对比

评测维度

Kimi3NEW

Kimi K2.6

GPT-5.4

DeepSeek V4

Kimi3 vs K2.6提升

复杂推理

⭐⭐⭐⭐⭐ 94

⭐⭐⭐⭐ 83

⭐⭐⭐⭐⭐ 96

⭐⭐⭐⭐⭐ 91

+11分

数学/逻辑

⭐⭐⭐⭐⭐ 91

⭐⭐⭐ 76

⭐⭐⭐⭐⭐ 94

⭐⭐⭐⭐⭐ 93

+15分最大提升

代码能力

⭐⭐⭐⭐ 88

⭐⭐⭐ 78

⭐⭐⭐⭐⭐ 94

⭐⭐⭐⭐⭐ 92

+10分

长文档处理(>100K)

⭐⭐⭐⭐⭐ 96

⭐⭐⭐⭐⭐ 92

⭐⭐⭐ 68

⭐⭐⭐ 62

+4分

短文本问答

⭐⭐⭐⭐⭐ 90

⭐⭐⭐⭐ 82

⭐⭐⭐⭐⭐ 95

⭐⭐⭐⭐⭐ 93

+8分

指令遵循

⭐⭐⭐⭐⭐ 93

⭐⭐⭐⭐ 84

⭐⭐⭐⭐⭐ 95

⭐⭐⭐⭐ 86

+9分

中文理解

⭐⭐⭐⭐⭐ 95

⭐⭐⭐⭐⭐ 94

⭐⭐⭐⭐ 85

⭐⭐⭐⭐⭐ 95

+1分

响应效率

⭐⭐⭐⭐ 82

⭐⭐⭐ 70

⭐⭐⭐⭐⭐ 90

⭐⭐⭐⭐⭐ 95

+12分

四个超出预期的提升

提升一:数学和逻辑——Kimi3最大的升级点

Kimi K2.6的数学能力只能用"一般"来形容——在需要多步推理的场景中经常出错。Kimi3在这方面几乎是脱胎换骨。我们用20道标准数学推理题测试,K2.6答对了14题(70%),Kimi3答对了19题(95%)——和GPT-5.4的19题持平。

在金融分析场景中——需要从财报数据中做多层计算推导——Kimi3的表现甚至让我觉得它换了底层架构。K2.6经常在第二步推导就出错,Kimi3能稳定走完3-4步推导并保持逻辑一致。

提升二:速度——Kimi的"慢"标签可以撕掉了

K2.6最大的槽点就是慢。处理50万字文档,K2.6平均需要4分12秒。Kimi3在同任务下只需要2分48秒——快了34%。虽然仍然比DeepSeek V4的30秒慢,但已经进入了"可以接受的等待时间"。考虑到长文档场景中Kimi3的准确率优势(96分 vs DeepSeek的62分),这2分多钟的等待换来的价值是值得的。

在短文本场景,Kimi3的响应速度提升更明显——从K2.6的平均2.1秒缩短到了0.9秒,已经接近DeepSeek V4的0.5秒水平。

提升三:指令遵循——不再"自作主张"

K2.6有一个让人头疼的习惯:有时候你让它"只输出JSON格式",它会在JSON前后加一段解释文字。Kimi3在指令遵循上严格得多——在我们测试的30条格式控制指令中,K2.6严格遵守了22条(73%),Kimi3遵守了28条(93%)。

这个提升对开发者很重要。当你在生产环境中用Kimi做数据抽取、要求它严格按JSON格式返回时,K2.6的"不听话"会导致解析失败。Kimi3基本解决了这个问题。

提升四:短文本场景——Kimi开始"抢地盘"了

以前你不会在短文本客服场景中用Kimi——太慢、太贵、效果也没有比DeepSeek好。但Kimi3在短文本问答上的表现(90分)已经足够好——虽然仍略逊于GPT-5.4(95分)和DeepSeek V4(93分),但差距已经从K2.6时代的13分缩小到了3-5分。考虑到Kimi3在长文本上的绝对优势,它可以同时承担"短文本快速问答"和"长文本深度分析"两类任务——一个模型覆盖更多场景,简化了模型路由的复杂度。

Kimi3最务实的用法建议:

超过20%的任务需要处理长文档

99%都是短文本

TokenStar上调用Kimi3的体验:API和K2.6完全兼容,切换零成本

这是最让我惊喜的一点。在TokenStar上从K2.6切换到Kimi3,只需要在API请求里把model参数从kimi-k2.6改成kimi-3——一行代码都不用改。Prompt不需要重新优化、输出格式不需要重新解析、Virtual Key的权限设置也不需要调整。

我们花了大概10分钟完成了从测试到全量切换——先在5%的流量上跑Kimi3,确认输出质量和延迟都没问题,然后逐步放量到100%。TokenStar的模型灰度切换功能让这个过程完全无感——用户端没有感知到模型切换。

Kimi3让Kimi从"长文档专用工具"进化成了"通用主力模型"。推理、数学、指令遵循三大短板的补齐,加上本就独步天下的长文档能力,加上响应速度的大幅提升——Kimi3现在是全场景覆盖能力最强的国产模型之一。

TokenStar(tokenstar.world)作为首批上线Kimi3的聚合平台,提供了从K2.6无缝升级到Kimi3的最便捷路径。一行代码不改,10分钟完成全量切换。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐