国产大模型全球调用量登顶:AI办公三国杀背后的成本革命与生态之战

点点词元技术专栏 · 第47号


摘要:2026年8月,两则数据在全球AI行业引发震动:DeepSeek V4-Flash单日消耗8.83万亿Token登顶OpenRouter全球调用榜,OpenRouter前五席位全部被中国模型包揽;与此同时,腾讯WorkBuddy、字节飞书豆包、阿里千问办公三大AI办公产品同日宣布重大更新,中国AI办公赛道正式进入"三国杀"格局。一边是国产模型在开发者调用量上首次全面超越GPT和Claude,一边是三大巨头在B端办公市场贴身肉搏——这两个看似独立的事件,背后指向同一个产业拐点:中国大模型正在从"能力追赶"走向"商用爆发",而决定胜负的不再是参数规模,而是成本结构和生态壁垒。 本文拆解这场双重战争的技术逻辑、商业博弈和开发者机遇。


一、8.83万亿Token:一个标志性的数字

1.1 数字背后的爆发

8月1日,DeepSeek V4-Flash在OpenRouter平台上创下了一个惊人的记录:单日消耗8.83万亿Token

其中5万亿来自免费额度,3.83万亿来自OpenCode Go付费用户。OpenCode创始人在社交平台发帖后,获得79.8万次浏览,直接把 #DeepSeek一天干掉了全人类的阅读量 送上热搜。

这是什么概念?

据研究估算,人类有史以来所有书面文本的总量约为300万亿Token。DeepSeek V4-Flash一天"吃掉"的Token量,相当于全人类书面文明的大约三十分之一。

1.2 OpenRouter前五全是国产模型

更震撼的是整体排名。OpenRouter最新周度Token调用榜显示:

排名 模型 厂商 日均Token调用量
1 DeepSeek-V4-Flash DeepSeek 8.83万亿
2 Qwen3.8-Max 阿里巴巴
3 Kimi K3 月之暗面
4 GLM-5.2 智谱AI
5 Seedance 2.5 字节跳动
6+ GPT-5.6系列 OpenAI 被挤出前五

国产大模型包揽前五名,这是历史上第一次。

这意味着什么?在全球开发者最常用的模型聚合平台上,中国模型的商用热度已经全面超越了GPT和Claude系列。

1.3 为什么是DeepSeek V4-Flash?

DeepSeek V4-Flash登顶并非偶然,而是一次精准的产品定位胜利:

  • MoE架构:总参数284B,激活参数仅13B,推理成本极低
  • 100万Token上下文:满足绝大多数长文档处理需求
  • 后训练重做:Agent能力超越4月发布的Pro Preview版本
  • 定价策略:被称为"只收电费钱",性价比碾压

梁文锋的DeepSeek,曾经是让整个AI行业降价的"价格屠夫"。现在,它用V4-Flash证明了:在开发者市场,成本效率才是王道。


二、成本革命:4B模型追平GPT-5.6 Sol

2.1 一个令人震惊的实验

Neon与Castform联合发布了一个实验结果:

一个4B参数的开源模型,经过RL后训练后,在检索任务上的准确率追平了GPT-5.6 Sol,但每次请求成本仅为1/100。

不是追平GPT-3.5,不是追平GPT-4,是追平GPT-5.6 Sol——目前OpenAI最强的推理模型之一。

4B参数 vs 可能数万亿参数的GPT-5.6 Sol,成本相差100倍,但在特定任务上效果相当。

这说明什么?

参数规模不再是唯一答案。 小模型 + 精准后训练 = 大模型的命。

2.2 MoE架构的成本魔法

国产模型集体爆发的技术底座,是MoE(Mixture of Experts,混合专家)架构的成熟:

模型 总参数 激活参数 激活比例
DeepSeek V4-Flash 284B 13B 4.6%
Qwen3.8-Max 2.4T 95B 4.0%
Kimi K3 2.8T ~280B ~10%

MoE的核心逻辑是:训练时保留海量参数存储知识,推理时只激活一小部分"专家"处理当前任务。

这意味着:

  • 训练成本高(需要大量参数)
  • 推理成本低(每次只激活一小部分)
  • 性价比极高(适合大规模商用)

2.3 价格战已经打到地板

看看当前的API定价(每百万Token):

模型 输入价格 输出价格 备注
DeepSeek V4-Flash 约¥1 约¥4 “只收电费”
Qwen3.8-Max ¥12 ¥36 Max级首次开源
GPT-5.6 Luna $0.20 $1.20 OpenAI免费版
Claude Opus 5 $5 $25 Anthropic旗舰

国产模型的价格,已经是海外模型的1/10到1/100

这不是简单的"便宜",而是一次成本结构的革命。当推理成本下降两个数量级,很多原本"不划算"的AI应用场景变得可行了。


三、AI办公三国杀:三大巨头同日开打

3.1 三方的底牌

2026年8月,中国AI办公赛道正式进入"三国杀"格局:

腾讯WorkBuddy

  • 月访问量:2097万次(超第二第三名总和)
  • 核心壁垒:微信生态导流
  • 马化腾亲自盯产品会议
  • 定位:C端入口 + 轻量办公

字节飞书豆包

  • 组织架构:飞书产品团队并入豆包
  • 核心能力:Seedance 2.5(视频生成SOTA)
  • 商业数据:飞书新增客户90%+同步采购AI产品
  • 定位:B端办公 + AI原生

阿里千问办公

  • 基座模型:Qwen3.8-Max(2.4T参数,全球Agentic Index第一)
  • 生态打通:钉钉IM + 淘宝 + 支付宝 + 高德
  • 千问月活:3亿+
  • 定位:企业级全栈AI办公

3.2 各自的护城河

腾讯:微信生态的降维打击

WorkBuddy的核心优势不在模型能力,而在微信生态。

当其他产品还在想怎么让用户下载App、注册账号时,WorkBuddy直接在微信小程序里就能用。用户不需要改变任何习惯,打开微信就是AI办公。

月访问量2097万次,超过第二名和第三名的总和——这就是微信生态的恐怖之处。

字节:从"玩具"到"生产力工具"

Seedance 2.5有一个有意思的数据:调用量"工作日远高于周末"

这说明它已经从"周末在家玩玩"的玩具,变成了"工作日真正在用"的生产力工具。

飞书新增客户90%以上同步采购AI产品,说明字节的B端商业化正在跑通。

阿里:全栈AI的生态协同

阿里的打法是"全栈":

  • 底层:阿里云 + AI芯片
  • 中间:Qwen大模型
  • 上层:千问Agent + 办公产品
  • 外围:淘宝、支付宝、高德等真实业务

用户一句话,搜索、比价、支付、物流可以串成一条任务链。这是纯模型公司做不到的。

3.3 窗口期只有6-12个月

行业分析认为,AI办公赛道的窗口期可能只有6-12个月

原因:

  1. 用户迁移成本高:一旦用户在一个平台上建立了工作流,切换成本很高
  2. 生态壁垒强:微信、钉钉、飞书各自有庞大的存量用户
  3. 先发优势明显:谁先跑出来,谁就能锁定用户习惯

这意味着,三大巨头正在抢的,不是"谁的产品更好",而是"谁先占领用户心智"。


四、护城河在哪?不是模型能力,是组织关系

4.1 一个反直觉的结论

很多人以为AI办公的护城河是模型能力——谁的大模型更聪明,谁就赢。

但事实可能恰恰相反。

模型能力可以快速迭代,今天你领先,下个月我可能就追上了。但组织关系、审批流、业务上下文——这些东西一旦建立,迁移成本极高。

4.2 企业级市场的真正壁垒

对于企业用户来说,选择AI办公产品考虑的不仅是"AI聪不聪明",而是:

  • 能不能和我现有的OA系统打通?
  • 审批流能不能自动化?
  • 历史数据能不能迁移?
  • 权限管理够不够细?
  • 合规要求能不能满足?

这些"脏活累活",才是企业级市场的真正壁垒。

4.3 C端 vs B端:两条不同的路

C端(个人用户)

  • 决策快,切换成本低
  • 看重"好用不好用"
  • 微信生态有天然优势

B端(企业用户)

  • 决策慢,需要层层审批
  • 看重"稳不稳定、合不合规"
  • 钉钉、飞书有存量优势

阿里千问办公走的是B端路线(钉钉+2000万组织),腾讯WorkBuddy走的是C端路线(微信+10亿用户),字节飞书豆包则是B+C混合。

三条路线,三种打法,谁能跑出来?


五、Qwen3.8-Max:开源旗舰的拐点意义

5.1 三个"第一次"

阿里8月3日发布的Qwen3.8-Max,同时完成了三件事:

  1. 能力对标Claude Fable 5:在多项基准上追平或超越闭源旗舰
  2. 首次开源Max级权重:开发者可以拿到满血版本,而不是"低配学生版"
  3. 国际价砍到Opus 5的1/4:输入$2/百万Token,输出$6/百万Token

这是国产大模型第一次同时完成这三件事。

5.2 16天自主编程:长程Agent能力的证明

Qwen3.8-Max最震撼的演示是:

在完全无人工干预的环境下,模型自主运行约16天,留下265次commit127个PR,产出一个名为"oh-my-cli"的自进化智能体框架。

不是"写一段代码",而是"连续干十几天活"。

这证明了一件事:开源模型也能做长程Agent任务——这正是无数中小团队等的那把钥匙。

5.3 开源拐点:从"能聊"到"能干重活"

过去一年,开源模型的处境是:能聊、能写、但干不了重活;顶级的Agent能力总在闭源旗舰手里。

Qwen3.8-Max用"16天自主编程"证明:长程Agent能力可以被开源拿到。

权重开源后,开发者可以:

  • 自己部署
  • 自己微调
  • 自己审计
  • 不被任何一家API绑死

这是开源社区等了很久的拐点。


六、开发者行动指南:成本革命时代的生存法则

6.1 成本下降100倍意味着什么?

当推理成本从"几十美元/百万Token"降到"几美分/百万Token",很多原本"不划算"的AI应用场景变得可行了:

  • 全量日志分析:以前只能抽样,现在可以全量
  • 实时翻译:以前只能做关键场景,现在可以做全场景
  • 个性化推荐:以前只能粗粒度,现在可以每个用户一条prompt
  • 文档智能:以前只能做摘要,现在可以做全量理解

6.2 多模型架构的必要性

成本革命带来的另一个变化:不同模型的成本差异巨大

  • 简单任务:用4B开源模型,成本1/100
  • 复杂推理:用GPT-5.6 Sol或Claude Opus 5
  • 长文档处理:用Qwen3.8-Max或DeepSeek V4-Flash(100万上下文)

你的系统应该能根据任务复杂度,自动选择性价比最高的模型。

6.3 为什么"聚合平台"成为基础设施

在多模型时代,开发者需要:

  • 一个API端点,背后连接数十家供应商的数百个模型
  • 根据任务自动路由到最优模型
  • 统一计费、配额管理、用量监控
  • 主供应商故障时,自动切换

这也是为什么模型聚合平台正在成为AI时代的基础设施。


结语:从"能力追赶"到"商用爆发"

2026年8月的这两组数据,标志着中国AI产业的一个拐点:

  • DeepSeek V4-Flash单日8.83万亿Token:国产模型在开发者调用量上首次全面超越GPT和Claude
  • AI办公三国杀:腾讯、字节、阿里同日开打,抢的是未来6-12个月的用户心智

这两个事件的共同指向是:中国大模型正在从"能力追赶"走向"商用爆发"。

过去两年,国产模型的叙事是"追赶"——追GPT、追Claude、追排行榜。

现在,叙事变了。变成了"谁能让开发者用起来"、“谁能让企业愿意买单”、“谁能建立真正的生态壁垒”。

决定胜负的不再是参数规模,而是:

  • 成本结构:推理成本能不能降到1/100?
  • 生态壁垒:微信、钉钉、飞书,谁能锁定用户?
  • 开源策略:权重开放还是闭源?开发者选谁?

对于开发者而言,这是一个黄金时代:

  • 模型成本下降两个数量级
  • 开源旗舰能力追平闭源
  • 多模型架构让你自由切换

谁能用好这波成本革命,谁就能在AI时代抢占先机。


相关资源:
模型广场:h5.datatoken.vip
小程序"点点词元" — 多模型统一调度平台,OpenAI 兼容协议,Anthropic 兼容协议。
GitHub 配套源码:https://github.com/fangzehui/llm-tech-articles/tree/main/chapters/chapter-47-domestic-llm-office-war
(含本文用到的国产大模型调用量数据与AI办公三国杀分析源码)

上下文延伸阅读:


当参数规模不再是护城河,成本结构和生态壁垒才是。 DeepSeek V4-Flash用8.83万亿Token证明:在开发者市场,性价比才是王道;腾讯、字节、阿里用三大AI办公产品证明:在B端市场,生态才是护城河。这两条线索最终指向同一个结论——中国AI产业正在从"能力追赶"走向"商用爆发",而决定胜负的,是谁能让开发者用得起、让企业离不开。

对于开发者而言,多模型架构已经是2026年的必备策略。模型广场 h5.datatoken.vip 提供近100种主流大模型的统一接入,从4B开源小模型到Max级旗舰,智能路由自动选择最优方案,让你的AI应用既聪明又省钱。


本文关于国产大模型调用量数据、AI办公三国杀、Qwen3.8-Max发布等内容来源于OpenRouter官方数据、36氪、界面新闻、阿里官方公告等多源报道,截至2026年8月12日。大模型领域变化较快,产品定价与技术参数请以各厂商官方渠道实时信息为准。文中分析仅基于公开信息整理,不代表任何厂商的商业推荐,具体模型选型请以自家业务评估为准。如发现事实性错误,欢迎评论区指正。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐