本文基于阿里巴巴 Qwen 团队 2026 年 7 月 19 日在 X 平台发布的公告及多方报道,结合公开基准数据和行业分析撰写。所有厂商自评均已标注。

12 小时后,国产大模型格局变了

2026 年 7 月 19 日,阿里巴巴通义千问团队在 X 上发出了一条简洁的推文:

“Qwen3.8 即将发布,并将很快开源权重。该模型拥有高达 2.4T 的参数,我们相信它是目前最强大的模型之一,仅次于 Fable 5。”

消息发布后 15 小时内,Qwen3.8-Max-Preview 已在阿里 Token Plan、Qoder 和 QoderWork 开放体验。国内开发者还来不及消化 Kimi K3 的冲击,又一个万亿参数级的对手登场了。

这条推文信息量看起来不大,但背后有几个关键问题值得深挖。

2.4T 参数:它有多大?

先说数字。2.4 万亿参数(2.4T),放在当前国产大模型的坐标系里:

模型 参数量 架构 开源状态
Kimi K3 2.8T KDA(3:1 混合线性注意力)+ MoE 896 专家 承诺 7 月 27 日前开源权重
Qwen3.8 2.4T 未公布(推测 MoE 架构) 正式版发布后开源权重
GLM-5.2 ~1T MoE 已开源
DeepSeek V3 671B MoE 已开源

值得注意的是:2.4T 大概率是 MoE(混合专家)架构的总参数量,而非激活参数量。Qwen 团队没有公布具体的激活参数、专家数量和路由策略——这些信息通常只在正式技术报告中披露。

从 Kimi K3 的经验来看,896 位专家中每 token 激活 16 位(约 1.8%),2.8T 总参数对应的激活参数约在 50B 级别。Qwen3.8 如果采用类似设计,激活参数量也可能在 40-60B 区间——这是推理时可以实际触摸到的"开销"。

“仅次于 Fable 5”——这个说法站得住吗?

这是整条推文里最值得细看的一句话。先说结论:尚未有独立的第三方验证。

Qwen 团队的声明用的是"我们相信"(We believe),这是厂商自评的标准措辞。Kimi K3 在 7 月上旬发布时也做过类似的表述,但随后的 Artificial Analysis 智能指数将各家排成了:

排名 模型 AA 智能指数
1 Claude Fable 5 60
2 GPT-5.6 Sol 59
3 Kimi K3 57

Qwen3.8 目前还未入榜。这意味着"仅次于 Fable 5"是一个尚未被外部基准验证的定位。

已有的泄露评测数据

不过,已有来自中文 AI 社区的非官方评测可以参考。根据多个测试渠道汇总:

  • 编码能力:在 400 个真实 Agent 任务中,Qwen3.8-Max-Preview 的得分落后 Fable 5 约 12.6 分
  • 与同级模型对比:在同样的测试中,Qwen3.8 超过 Kimi K3 约 8 分、超过 GLM-5.2 约 17.1 分
  • 代码同质度:约 73.2% 的编码任务输出与 Fable 5 一致——这是一个有趣的数据,可能意味着深度对齐策略或训练数据的相似度较高

重要前提:以上均为非官方泄露数据,未经过标准 benchmark 流程验证,参考价值有限。

非编码能力的隐忧

另一个来自社区评测的反馈是:Qwen3.8-Max-Preview 的非编码能力优化明显不足。有测试者发现它在 3D 模型生成、多模态理解等场景的表现不如 GPT-5.6 Sol 和 Fable 5。

这一点也在情理之中——预览版的核心重心明显放在编程场景,正式版可能通过后续训练补齐其他维度的能力。Qwen 团队明确表示模型仍在"以天为单位持续进化"。

开源策略:这次对开发者意味着什么?

Qwen 系列一直是中国大模型开源的重要力量。从 Qwen2.5 到 Qwen3.7,每次都是"发布即开源"的模式。但这次的表述是:正式版发布后开源权重

这里有三个细节值得注意:

1. “开源权重"不是"开源模型”
“Open-weight”(开源权重)和 “Open-source”(开源)是两回事。权重开源意味着你可以下载模型参数并本地部署,但不包括训练代码、训练数据、评估代码。这和 Kimi K3 承诺的 Modified MIT 协议类似,属于类 Linux Foundation Class III 级别。

2. 本地部署的门槛
2.4T 总参数意味着量化后至少需要 400-600GB 显存才能完整运行——这需要 4-8 张 A100/H100。对于个人开发者,更现实的方式是使用 API 或阿里云的 Token Plan 服务(个人版 39 元/月起,日间信用点 1 折)。

3. 推理效率是关键变量
MoE 架构的优势在于总参数大但激活参数少,推理速度快。Qwen3.8 如果激活参数控制在 50B 级别,在消费级硬件上做 4-bit 量化后,单张 4090 或 5090 可能勉强运行。但从 Kimi K3 的实际体验来看,MoE 架构在消费级硬件上的推理速度远不如同规模的密集模型——K3 在实际使用中比 Fable 5 慢 2-3 倍。Qwen3.8 的推理效率还需要实测。

为什么是现在?

Qwen3.8 的发布时间点值得玩味。7 月上旬 Kimi K3 发布,7 月 19 日 Qwen3.8 预告,同一天有消息称 DeepSeek V4 也可能在近日发布。

这不是巧合。2026 年 7 月,国产大模型正进入一个密集发布窗口。三家各有定位:

阵营 模型 参数量 核心差异
月之暗面 Kimi K3 2.8T 自研 KDA 架构,长上下文 1M,企业应用
阿里云 Qwen3.8 2.4T 开源权重,阿里云生态,编码能力优先
深度求索 DeepSeek V4正式版(传闻) 未公布 极致性价比,API 价格仅为竞品 1/10

对开发者来说,三个模型无论哪个胜出,结果都是好的——竞争推动质量上升、价格下降。

现在能怎么用?

Qwen3.8-Max-Preview 已经可以在以下平台体验:

  • Token Plan(国际站 / 中国站)—— 个人版 ¥39/月起
  • Qoder / QoderWork —— 编程场景优先
  • 千问 PC 端 —— 免费体验

如果你是开发者,最快的方式是直接在 Token Plan 上试用,重点关注它在代码生成、代码审查、Agent 工作流等场景的表现——这显然是 Qwen3.8 这次的主攻方向。

总结

一句话:Qwen3.8 是阿里在这个时间窗口必须出的牌。2.4T 参数、编码能力优先、开源权重的组合,让它对开发者有实实在在的吸引力。"仅次于 Fable 5"的宣称需要独立验证,但即便实际排名在 Fable 5 和 GPT-5.6 Sol 之后、与 Kimi K3 同级,它的存在本身就意味着国产大模型的可选项又多了一个重量级选手。

对开发者最重要的是:正式版发布 + 权重开源 = 你可以在自己的硬件上跑一个 2.4T 参数的模型。 这在一年前还是不可想象的。


数据来源:@Alibaba_Qwen X 官方推文(2026-07-19);IT之家、SCMP、凤凰科技、搜狐科技等多家媒体报道;中文 AI 社区非官方测试数据。所有 benchmark 声明在独立第三方验证前的参考价值有限。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐