47号_国产大模型全球调用量登顶_AI办公三国杀
国产大模型全球调用量登顶:AI办公三国杀背后的成本革命与生态之战
点点词元技术专栏 · 第47号
摘要:2026年8月,两则数据在全球AI行业引发震动:DeepSeek V4-Flash单日消耗8.83万亿Token登顶OpenRouter全球调用榜,OpenRouter前五席位全部被中国模型包揽;与此同时,腾讯WorkBuddy、字节飞书豆包、阿里千问办公三大AI办公产品同日宣布重大更新,中国AI办公赛道正式进入"三国杀"格局。一边是国产模型在开发者调用量上首次全面超越GPT和Claude,一边是三大巨头在B端办公市场贴身肉搏——这两个看似独立的事件,背后指向同一个产业拐点:中国大模型正在从"能力追赶"走向"商用爆发",而决定胜负的不再是参数规模,而是成本结构和生态壁垒。 本文拆解这场双重战争的技术逻辑、商业博弈和开发者机遇。
一、8.83万亿Token:一个标志性的数字
1.1 数字背后的爆发
8月1日,DeepSeek V4-Flash在OpenRouter平台上创下了一个惊人的记录:单日消耗8.83万亿Token。
其中5万亿来自免费额度,3.83万亿来自OpenCode Go付费用户。OpenCode创始人在社交平台发帖后,获得79.8万次浏览,直接把 #DeepSeek一天干掉了全人类的阅读量 送上热搜。
这是什么概念?
据研究估算,人类有史以来所有书面文本的总量约为300万亿Token。DeepSeek V4-Flash一天"吃掉"的Token量,相当于全人类书面文明的大约三十分之一。
1.2 OpenRouter前五全是国产模型
更震撼的是整体排名。OpenRouter最新周度Token调用榜显示:
| 排名 | 模型 | 厂商 | 日均Token调用量 |
|---|---|---|---|
| 1 | DeepSeek-V4-Flash | DeepSeek | 8.83万亿 |
| 2 | Qwen3.8-Max | 阿里巴巴 | — |
| 3 | Kimi K3 | 月之暗面 | — |
| 4 | GLM-5.2 | 智谱AI | — |
| 5 | Seedance 2.5 | 字节跳动 | — |
| 6+ | GPT-5.6系列 | OpenAI | 被挤出前五 |
国产大模型包揽前五名,这是历史上第一次。
这意味着什么?在全球开发者最常用的模型聚合平台上,中国模型的商用热度已经全面超越了GPT和Claude系列。
1.3 为什么是DeepSeek V4-Flash?
DeepSeek V4-Flash登顶并非偶然,而是一次精准的产品定位胜利:
- MoE架构:总参数284B,激活参数仅13B,推理成本极低
- 100万Token上下文:满足绝大多数长文档处理需求
- 后训练重做:Agent能力超越4月发布的Pro Preview版本
- 定价策略:被称为"只收电费钱",性价比碾压
梁文锋的DeepSeek,曾经是让整个AI行业降价的"价格屠夫"。现在,它用V4-Flash证明了:在开发者市场,成本效率才是王道。
二、成本革命:4B模型追平GPT-5.6 Sol
2.1 一个令人震惊的实验
Neon与Castform联合发布了一个实验结果:
一个4B参数的开源模型,经过RL后训练后,在检索任务上的准确率追平了GPT-5.6 Sol,但每次请求成本仅为1/100。
不是追平GPT-3.5,不是追平GPT-4,是追平GPT-5.6 Sol——目前OpenAI最强的推理模型之一。
4B参数 vs 可能数万亿参数的GPT-5.6 Sol,成本相差100倍,但在特定任务上效果相当。
这说明什么?
参数规模不再是唯一答案。 小模型 + 精准后训练 = 大模型的命。
2.2 MoE架构的成本魔法
国产模型集体爆发的技术底座,是MoE(Mixture of Experts,混合专家)架构的成熟:
| 模型 | 总参数 | 激活参数 | 激活比例 |
|---|---|---|---|
| DeepSeek V4-Flash | 284B | 13B | 4.6% |
| Qwen3.8-Max | 2.4T | 95B | 4.0% |
| Kimi K3 | 2.8T | ~280B | ~10% |
MoE的核心逻辑是:训练时保留海量参数存储知识,推理时只激活一小部分"专家"处理当前任务。
这意味着:
- 训练成本高(需要大量参数)
- 推理成本低(每次只激活一小部分)
- 性价比极高(适合大规模商用)
2.3 价格战已经打到地板
看看当前的API定价(每百万Token):
| 模型 | 输入价格 | 输出价格 | 备注 |
|---|---|---|---|
| DeepSeek V4-Flash | 约¥1 | 约¥4 | “只收电费” |
| Qwen3.8-Max | ¥12 | ¥36 | Max级首次开源 |
| GPT-5.6 Luna | $0.20 | $1.20 | OpenAI免费版 |
| Claude Opus 5 | $5 | $25 | Anthropic旗舰 |
国产模型的价格,已经是海外模型的1/10到1/100。
这不是简单的"便宜",而是一次成本结构的革命。当推理成本下降两个数量级,很多原本"不划算"的AI应用场景变得可行了。
三、AI办公三国杀:三大巨头同日开打
3.1 三方的底牌
2026年8月,中国AI办公赛道正式进入"三国杀"格局:
腾讯WorkBuddy
- 月访问量:2097万次(超第二第三名总和)
- 核心壁垒:微信生态导流
- 马化腾亲自盯产品会议
- 定位:C端入口 + 轻量办公
字节飞书豆包
- 组织架构:飞书产品团队并入豆包
- 核心能力:Seedance 2.5(视频生成SOTA)
- 商业数据:飞书新增客户90%+同步采购AI产品
- 定位:B端办公 + AI原生
阿里千问办公
- 基座模型:Qwen3.8-Max(2.4T参数,全球Agentic Index第一)
- 生态打通:钉钉IM + 淘宝 + 支付宝 + 高德
- 千问月活:3亿+
- 定位:企业级全栈AI办公
3.2 各自的护城河
腾讯:微信生态的降维打击
WorkBuddy的核心优势不在模型能力,而在微信生态。
当其他产品还在想怎么让用户下载App、注册账号时,WorkBuddy直接在微信小程序里就能用。用户不需要改变任何习惯,打开微信就是AI办公。
月访问量2097万次,超过第二名和第三名的总和——这就是微信生态的恐怖之处。
字节:从"玩具"到"生产力工具"
Seedance 2.5有一个有意思的数据:调用量"工作日远高于周末"。
这说明它已经从"周末在家玩玩"的玩具,变成了"工作日真正在用"的生产力工具。
飞书新增客户90%以上同步采购AI产品,说明字节的B端商业化正在跑通。
阿里:全栈AI的生态协同
阿里的打法是"全栈":
- 底层:阿里云 + AI芯片
- 中间:Qwen大模型
- 上层:千问Agent + 办公产品
- 外围:淘宝、支付宝、高德等真实业务
用户一句话,搜索、比价、支付、物流可以串成一条任务链。这是纯模型公司做不到的。
3.3 窗口期只有6-12个月
行业分析认为,AI办公赛道的窗口期可能只有6-12个月。
原因:
- 用户迁移成本高:一旦用户在一个平台上建立了工作流,切换成本很高
- 生态壁垒强:微信、钉钉、飞书各自有庞大的存量用户
- 先发优势明显:谁先跑出来,谁就能锁定用户习惯
这意味着,三大巨头正在抢的,不是"谁的产品更好",而是"谁先占领用户心智"。
四、护城河在哪?不是模型能力,是组织关系
4.1 一个反直觉的结论
很多人以为AI办公的护城河是模型能力——谁的大模型更聪明,谁就赢。
但事实可能恰恰相反。
模型能力可以快速迭代,今天你领先,下个月我可能就追上了。但组织关系、审批流、业务上下文——这些东西一旦建立,迁移成本极高。
4.2 企业级市场的真正壁垒
对于企业用户来说,选择AI办公产品考虑的不仅是"AI聪不聪明",而是:
- 能不能和我现有的OA系统打通?
- 审批流能不能自动化?
- 历史数据能不能迁移?
- 权限管理够不够细?
- 合规要求能不能满足?
这些"脏活累活",才是企业级市场的真正壁垒。
4.3 C端 vs B端:两条不同的路
C端(个人用户):
- 决策快,切换成本低
- 看重"好用不好用"
- 微信生态有天然优势
B端(企业用户):
- 决策慢,需要层层审批
- 看重"稳不稳定、合不合规"
- 钉钉、飞书有存量优势
阿里千问办公走的是B端路线(钉钉+2000万组织),腾讯WorkBuddy走的是C端路线(微信+10亿用户),字节飞书豆包则是B+C混合。
三条路线,三种打法,谁能跑出来?
五、Qwen3.8-Max:开源旗舰的拐点意义
5.1 三个"第一次"
阿里8月3日发布的Qwen3.8-Max,同时完成了三件事:
- 能力对标Claude Fable 5:在多项基准上追平或超越闭源旗舰
- 首次开源Max级权重:开发者可以拿到满血版本,而不是"低配学生版"
- 国际价砍到Opus 5的1/4:输入$2/百万Token,输出$6/百万Token
这是国产大模型第一次同时完成这三件事。
5.2 16天自主编程:长程Agent能力的证明
Qwen3.8-Max最震撼的演示是:
在完全无人工干预的环境下,模型自主运行约16天,留下265次commit与127个PR,产出一个名为"oh-my-cli"的自进化智能体框架。
不是"写一段代码",而是"连续干十几天活"。
这证明了一件事:开源模型也能做长程Agent任务——这正是无数中小团队等的那把钥匙。
5.3 开源拐点:从"能聊"到"能干重活"
过去一年,开源模型的处境是:能聊、能写、但干不了重活;顶级的Agent能力总在闭源旗舰手里。
Qwen3.8-Max用"16天自主编程"证明:长程Agent能力可以被开源拿到。
权重开源后,开发者可以:
- 自己部署
- 自己微调
- 自己审计
- 不被任何一家API绑死
这是开源社区等了很久的拐点。
六、开发者行动指南:成本革命时代的生存法则
6.1 成本下降100倍意味着什么?
当推理成本从"几十美元/百万Token"降到"几美分/百万Token",很多原本"不划算"的AI应用场景变得可行了:
- 全量日志分析:以前只能抽样,现在可以全量
- 实时翻译:以前只能做关键场景,现在可以做全场景
- 个性化推荐:以前只能粗粒度,现在可以每个用户一条prompt
- 文档智能:以前只能做摘要,现在可以做全量理解
6.2 多模型架构的必要性
成本革命带来的另一个变化:不同模型的成本差异巨大。
- 简单任务:用4B开源模型,成本1/100
- 复杂推理:用GPT-5.6 Sol或Claude Opus 5
- 长文档处理:用Qwen3.8-Max或DeepSeek V4-Flash(100万上下文)
你的系统应该能根据任务复杂度,自动选择性价比最高的模型。
6.3 为什么"聚合平台"成为基础设施
在多模型时代,开发者需要:
- 一个API端点,背后连接数十家供应商的数百个模型
- 根据任务自动路由到最优模型
- 统一计费、配额管理、用量监控
- 主供应商故障时,自动切换
这也是为什么模型聚合平台正在成为AI时代的基础设施。
结语:从"能力追赶"到"商用爆发"
2026年8月的这两组数据,标志着中国AI产业的一个拐点:
- DeepSeek V4-Flash单日8.83万亿Token:国产模型在开发者调用量上首次全面超越GPT和Claude
- AI办公三国杀:腾讯、字节、阿里同日开打,抢的是未来6-12个月的用户心智
这两个事件的共同指向是:中国大模型正在从"能力追赶"走向"商用爆发"。
过去两年,国产模型的叙事是"追赶"——追GPT、追Claude、追排行榜。
现在,叙事变了。变成了"谁能让开发者用起来"、“谁能让企业愿意买单”、“谁能建立真正的生态壁垒”。
决定胜负的不再是参数规模,而是:
- 成本结构:推理成本能不能降到1/100?
- 生态壁垒:微信、钉钉、飞书,谁能锁定用户?
- 开源策略:权重开放还是闭源?开发者选谁?
对于开发者而言,这是一个黄金时代:
- 模型成本下降两个数量级
- 开源旗舰能力追平闭源
- 多模型架构让你自由切换
谁能用好这波成本革命,谁就能在AI时代抢占先机。
相关资源:
模型广场:h5.datatoken.vip
小程序"点点词元" — 多模型统一调度平台,OpenAI 兼容协议,Anthropic 兼容协议。
GitHub 配套源码:https://github.com/fangzehui/llm-tech-articles/tree/main/chapters/chapter-47-domestic-llm-office-war
(含本文用到的国产大模型调用量数据与AI办公三国杀分析源码)
上下文延伸阅读:
- chapter-46-bytedance-10t-anti-distillation:字节10万亿参数大模型与反蒸馏路线之争
- chapter-45-opus5-deepseek-ai-standard:Opus5半价、DeepSeek 3500亿融资、AI国标三线齐发
- chapter-44-gpt6-pause-ai-brake:GPT-6暂停与AI刹车运动
当参数规模不再是护城河,成本结构和生态壁垒才是。 DeepSeek V4-Flash用8.83万亿Token证明:在开发者市场,性价比才是王道;腾讯、字节、阿里用三大AI办公产品证明:在B端市场,生态才是护城河。这两条线索最终指向同一个结论——中国AI产业正在从"能力追赶"走向"商用爆发",而决定胜负的,是谁能让开发者用得起、让企业离不开。
对于开发者而言,多模型架构已经是2026年的必备策略。模型广场 h5.datatoken.vip 提供近100种主流大模型的统一接入,从4B开源小模型到Max级旗舰,智能路由自动选择最优方案,让你的AI应用既聪明又省钱。
本文关于国产大模型调用量数据、AI办公三国杀、Qwen3.8-Max发布等内容来源于OpenRouter官方数据、36氪、界面新闻、阿里官方公告等多源报道,截至2026年8月12日。大模型领域变化较快,产品定价与技术参数请以各厂商官方渠道实时信息为准。文中分析仅基于公开信息整理,不代表任何厂商的商业推荐,具体模型选型请以自家业务评估为准。如发现事实性错误,欢迎评论区指正。
更多推荐




所有评论(0)