语言模型—
title: DeepSeek V4满血版价格屠夫——178倍价差下的全球最便宜前沿模型
tags: [语言模型, transformer, chatgpt]
category: AI / 大模型
date: 2026-07-21

DeepSeek V4满血版价格屠夫——178倍价差下的全球最便宜前沿模型

导读:DeepSeek V4正式版上线,首次引入峰谷计费。高峰时段价格翻倍——但即便翻倍,V4 Pro的输出价也只有Claude Fable 5的3.5%,V4 Flash更是只有Fable 5的0.56%。"价格屠夫"第一次装上了计价器,但刀依然是全世界最快的。本文拆解V4的完整定价体系、技术能力边界、市场冲击波,以及7月24日旧接口停用前你必须完成的迁移动作。


一、开篇:一把最快的刀,第一次配了价目表

2026年7月中旬,大模型API用户集体收到一封邮件。

DeepSeek宣布V4正式版(GA)上线,同步引入峰谷计费机制——每天上午9:00-12:00、下午14:00-18:00(北京时间),API调用价格翻倍。其余17个小时(含夜间、周末、节假日)执行平峰价格。

没看错,高峰翻倍

这是DeepSeek——这个在过去两年里把百万Token价格从几十块砍到几块钱的"价格屠夫"——第一次在自己的产品上安装"计价器"。

过去大模型API行业有一条铁律:价格只会往下走。厂商轮番降价,用户习惯了越来越便宜。DeepSeek自己就是这条铁律最激进的执行者:今年4月V4预览版上线,紧接着给V4-Pro开了2.5折限时特惠,5月22日又宣布永久降价75%。

结果6月29日,用户收到邮件才发现——刚给了折扣,转头就在高峰时段加价。这两步棋看起来矛盾,放在一起看,其实是同一套逻辑的两面:

"便宜"从来不是白给的,但"怎么用更便宜"这件事,第一次被写进了定价规则里。

更关键的是另一组数字。

Claude Fable 5的输出价格:50美元/百万Token

DeepSeek V4 Flash平峰输出价格:0.28美元/百万Token

最贵和最便宜的前沿模型之间,差了178倍

而V4 Pro在SWE-bench Verified上跑出80.6%,和Claude Opus 4.6的80.8%只差0.2个百分点——但价格只有Opus的1/57

这就是V4满血版的核心叙事:性能追平全球旗舰,成本降维打击。即便高峰时段价格翻倍,V4 Pro的输出价($1.74/百万Token)也只有Fable 5的3.5%。"涨价"之后的极端成本,依然远低于竞品的日常价格。


二、完整定价拆解:峰谷规则、价格表与真实成本

2.1 峰谷计费规则

DeepSeek V4的峰谷定价规则非常清晰,简单到"像家里的电表":

高峰时段(北京时间):

  • 上午 09:00 - 12:00
  • 下午 14:00 - 18:00
  • 合计7小时,价格为平峰的2倍

平峰时段

  • 其余17小时(含夜间、周末、节假日)
  • 执行标准价格

2.2 完整价格表

人民币定价(元/百万Token)

模型 计费项 平峰 高峰
V4 Pro 输出 6 12
输入(缓存未命中) 3 6
输入(缓存命中) 0.025 0.05
V4 Flash 输出 2 4
输入(缓存未命中) 1 2
输入(缓存命中) 0.02 0.04

美元定价($/百万Token)

模型 计费项 平峰 高峰
V4 Pro 输出 0.87 1.74
输入(缓存未命中) 0.435 0.87
输入(缓存命中) 0.025 0.05
V4 Flash 输出 0.28 0.56
输入(缓存未命中) 0.14 0.28
输入(缓存命中) 0.02 0.04

2.3 三个值得关注的定价细节

第一,缓存命中几乎免费。

V4 Pro缓存命中时的输入价格仅为未命中的1/120(0.025 vs 3元),V4 Flash为1/50(0.02 vs 1元)。如果你的应用有良好的缓存策略——比如重复的system prompt、常见的上下文片段——实际输入成本可以忽略不计。V4 Flash缓存命中输入低至$0.0028/百万Token,约等于白送。

第二,高峰翻倍后的价格,仍然碾压竞品日常价。

模型 输出价格($/M Token)
Claude Fable 5 50.00
GPT-5.6 Sol 30.00
Claude Opus 4.8 25.00
Kimi K3 13.79
DS V4 Pro(高峰 1.74
DS V4 Flash(高峰 0.56

V4 Pro高峰输出价是Fable 5的3.5%、GPT-5.6 Sol的5.8%、Kimi K3的12.6%。"涨价"之后的价格,依然比所有竞品便宜一个数量级以上。

第三,Pro和Flash的价差只有3倍。

V4 Pro输出¥6 vs V4 Flash输出¥2,差距只有3倍。但两者的性能差距远不止3倍(后面技术能力部分展开)。这意味着:如果你用的是对质量有一定要求的场景(代码审查、文档生成、数据分析),Pro版几乎是无脑选择——3倍的价格换来的是全面的质量提升。

2.4 峰谷计费的运营账本

峰谷计费上线后,DeepSeek官方披露了一组运营数据,可以用来检验这套定价逻辑是否真的有效:

指标 预览版(无峰谷) 正式版(峰谷计费) 变化
高峰算力利用率 常超110%(过载) 稳定85% 回归健康水位
服务响应延迟 20秒+ 平均1.2秒 改善94%
金融/代码核心业务可用性 不稳定 99.95% 生产可用
平峰批量任务成本 基线 降低40% 显著下降

这组数据回答了一个关键问题:峰谷计费到底是为了涨价,还是为了调度?

如果目的是涨价,没必要把平峰价格再降40%。真正的意图是:用高峰的溢价抑制过度集中的调用需求,用平峰的折扣引导延迟不敏感的任务(批量数据处理、离线分析、模型微调)转移到非工作时段。

结果也验证了这套逻辑的有效性——高峰负载从110%+降到85%,延迟从20秒降到1.2秒,平峰用户还拿到了更低价格。三方共赢,没有人在高峰时段多付的那一倍价格被"坑"——你买到的是从20秒到1.2秒的延迟改善。

2.5 与38号文章的呼应

上期《Token峰谷电价来了》讨论的是"分时计费"的行业趋势和概念框架。V4满血版则是这个概念在全球前沿模型中的第一次正式落地

从机制到实战,V4用实际价格表和运营数据证明了一件事:峰谷不是涨价,是调度工具

这不是理论推演,是有真实运营数据支撑的工程决策。当一种资源开始按时段定价,它就不再是普通商品,而是公用事业——跟电力、水务一样的基础设施。Token正在经历从"数字商品"到"数字公用事业"的身份转变。


三、技术能力:不是最强,但最值得用

3.1 核心基准测试

V4系列有三个版本:V4 Pro(1.6万亿参数,激活490亿)、V4 Flash(2840亿参数,激活130亿)、以及推理强度最高的V4-Pro-Max。全系标配100万Token上下文窗口,MIT协议完全开源可商用。

以下是V4-Pro-Max与主要竞品在核心基准上的对比:

基准测试 V4 Pro Max Claude Opus 4.6 GPT-5.4 Gemini 3.1 Pro
SWE-bench Verified 80.6% 80.8% 80.6%
SWE-bench Pro 55.4% 57.3% 57.7%
LiveCodeBench 93.5% 88.8% 91.7%
Codeforces Rating 3206 3168 3052
MMLU-Pro 87.5% 89.1% 87.5% 91.0%
GPQA Diamond 90.1% 91.3% 93.0% 94.3%
IMO AnswerBench 89.8% 75.3% 91.4% 81.0%

★ = 该维度全球第一

两个关键数据:

  • LiveCodeBench 93.5%,全球第一,比Opus 4.6高4.7个百分点
  • Codeforces 3206,全球AI最高分,超过GPT-5.4的3168
  • SWE-bench Verified 80.6%,追平Opus 4.6(差0.2%)、持平Gemini 3.1 Pro

编码能力是V4的核心战场,在这两个最权威的编码基准上,V4 Pro Max已经是全球天花板水平。

3.2 代际飞跃:V3.2 → V4

更值得关注的是代际提升幅度:

指标 V3.2 V4 Pro 提升幅度
LiveCodeBench 83.3 93.5 +10.2
Codeforces 2386 3206 +820分(+34%)
GPQA Diamond 82.4 90.1 +7.7
KV缓存占用 基线 基线的10% 降至1/10
推理算力 基线 基线的27% 降至1/4

最后一行才是真正的"价格屠夫密码"。

V4的推理算力只有V3.2的27%,KV缓存占用只有10%——这意味着同样的GPU资源,V4能跑出比V3.2多好几倍的Token。DeepSeek不是在亏本卖Token,是用架构创新把单位成本打了下来。

这里有几个关键技术突破值得展开:

  • mHC注意力机制(multi-head latent attention的进化版):将KV缓存压缩到原来的1/10,直接解决了长上下文场景下显存爆炸的问题。这也是V4全系能支持100万Token上下文的基础。
  • Engram持久记忆架构:让模型在压缩KV缓存的同时不丢失关键上下文信息。传统方案压缩缓存就丢精度,Engram做到了"压缩但不丢信息"。
  • DSA稀疏注意力(Dynamic Sparse Attention):推理时只关注最相关的Token,跳过无关部分的计算。这是推理算力降到27%的核心功臣。
  • CSA+HCA混合注意力:在长文本场景中动态切换稠密和稀疏模式,兼顾精度和效率。

这些技术名词背后,就是一个朴素的工程目标:让每张GPU卡干更多的活

另外一个经常被忽略的亮点:V4是首个全面适配华为昇腾的万亿参数模型。2026年下半年昇腾950超节点批量上市后,Pro版的推理成本还将进一步下降。这意味着DeepSeek的成本曲线还远没有触底——国产算力的跟进,会给已经极低的价格再砍一刀。

3.3 灰度测试中的真实表现

V4正式版7月中旬全量灰度以来,开发者社区的反馈可以分两面看:

共识性优势

  • 整体推理接近Claude Opus 4.8级别,编码直追GPT-5.6 Sol
  • Agent能力大幅增强,任务成功率从预览版76%提升至正式版92%
  • 创意写作词数较V3.2提升约48%,速度提升3倍
  • 52%受访开发者准备将V4-Pro作为主力编码模型替代方案

需要正视的短板

  • Pro版相对Flash性能提升幅度有限,常规场景感知不强
  • 同任务迭代轮数多于Claude Fable 5,"一步直达"的效率较弱
  • 幻觉率偏高(有评测称Pro版94%、Flash版96%不确定时会编造答案)
  • 长上下文精确位置召回弱于Claude Opus 4.6(MRCR 1M测试83.5% vs Opus 92.9%)

一句话总结:V4不是最强的,但在"性能/价格"这个比值上,目前没有对手

如果你的场景追求绝对精度、要求一步到位、需要完美的长文本精确召回——Claude Fable 5或Opus 4.8仍然是更好的选择,前提是你愿意为每百万Token多付50-178倍的价格。

如果你的场景是高频调用、批量处理、迭代式开发、对成本敏感的生产环境——V4 Pro是目前性价比的天花板。


四、市场冲击:470%的增长和一场定价权争夺

4.1 开发者用脚投票

V4正式版上线后的市场数据是惊人的:

  • 发布3天内,API调用量较预览版峰值增长470%
  • 企业级客户占比提升至62%
  • 89%的预览版企业用户在正式版推出后一周内完成升级
  • V4-Flash连续七周位居全球调用量前列,最新周调用量达5.35万亿Token

DeepSeek整体旗下模型占全球总调用量的18.5%,连续六周全球第一。

这些数字说明一件事:当价格低到一定程度,市场会自己做出选择

4.2 行业连锁反应

V4的定价冲击在2026年7月引发了史无前例的模型密集发布潮——三周内七家巨头十款新模型:

  • 6月30日,Anthropic发布Claude Sonnet 5
  • 7月8-9日,OpenAI GPT-5.6三款模型全量上线
  • 7月9日,Meta发布Muse Spark 1.1(定价为OpenAI的1/4)
  • 7月16-17日,Kimi K3正式发布(2.8万亿参数)
  • 7月17日,Google Gemini 3.5 Pro上线
  • 7月中旬,阿里Qwen3.8预览版上线(2.4万亿参数)

更深层的变化是渠道端的开放:

  • AWS Bedrock已接入MiniMax、Kimi、Qwen、DeepSeek、GLM等中国模型
  • 微软Azure接入DeepSeek
  • 腾讯云7月3日宣布同步上线V4正式版,跟随原厂引入峰谷定价

路透社的定性是:“DeepSeek此次永久降价,打破了全球高端大模型的定价体系,拉开了新一轮全球AI价格竞争序幕。”

4.3 中转平台还有价值吗?

一个跟开发者切身相关的问题:当DeepSeek官方价格已经这么低,中转平台(比如统一API路由服务)还有存在的必要吗?

根据第三方实测数据,中转方案比全部直连大约便宜25%。这个价差主要来自:

  • 平台批量采购的规模折扣
  • 缓存自动利用带来的隐性节省
  • 多模型统一路由减少的运维成本

但对于轻量级个人开发者,DeepSeek官方直充已经足够便宜——V4 Pro平峰输出仅¥6/百万Token,一个月日常使用成本在¥2-50之间。中转的25%折扣在这个量级上,边际收益有限。

对于高频调用、多模型混用的团队,中转的价值主要体现在工程层面:一个API Key统一管理、自动缓存命中、按需切换模型、跨境访问稳定性保障。这不是"便宜25%"的问题,是"少维护五套SDK"的问题。

V4 Pro的直充价格已经击穿了大多数中转平台的利润空间。当官方价低于中转的批发价时,中转的定价优势会收窄——但统一路由和工程便利性的价值不会消失。

这也是我们在做"点点词元"时的核心判断:当模型官方价格已经极低,中转平台的竞争力不在于"更便宜",而在于"更好用"——多模型统一接入、智能路由、缓存优化、故障自动切换。

举一个具体场景:你的应用白天高峰时段需要低延迟的实时响应(用V4 Pro高峰),凌晨跑批量数据清洗任务(用V4 Flash平峰),偶尔有超高精度需求(切Claude Opus)。如果没有统一路由,你需要维护三套SDK、三个API Key、三套计费逻辑。统一接入之后,一个端点、一个Key、一套代码,路由和调度在平台侧自动完成。

当单模型价格已经击穿地板,工程效率才是下一个成本优化维度。


五、7月24日大限:旧接口停用迁移指南

5.1 发生了什么

DeepSeek宣布:2026年7月24日15:59 UTCdeepseek-chatdeepseek-reasoner两个旧模型别名永久停用

这意味着如果你代码里还在用这两个模型名,7月24日之后你的应用会直接报错。

5.2 迁移映射表

旧模型名 替代方案 Thinking模式
deepseek-chat deepseek-v4-flash 关闭
deepseek-reasoner deepseek-v4-flash 开启

注意:deepseek-v4-pro是可选的质量升级,不是deepseek-reasoner的默认继任者。如果你之前用的是reasoner(深度思考模式),对应的是V4 Flash+开启Thinking。

5.3 迁移中的坑

第一,参数行为变化。

Thinking模式下,temperaturetop_pfrequency_penalty等参数全部失效。如果你之前在代码里依赖这些参数做输出控制,切换后需要同步调整。

第二,流式返回结构变化。

V4在streaming模式下会额外返回reasoning_content字段(思考过程),你需要在解析逻辑中处理这个新字段,否则可能导致下游报错。

第三,Token消耗结构变化。

Thinking模式下,思考过程也会消耗Token。如果你的应用有Token预算限制,需要重新评估——同样的任务,V4的Token消耗结构可能跟旧接口不同。

第四,不要只做"替换模型名"这一步。

单纯替换模型名可能改变延迟、Token消耗和响应结构。建议在测试环境完成完整回归测试后再上线。

5.4 迁移代码示例

如果你使用OpenAI兼容的SDK调用DeepSeek,迁移后的基础调用代码调整如下:

from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com/v1"
)

# 旧代码(7月24日后失效)
# response = client.chat.completions.create(
#     model="deepseek-chat",
#     messages=[{"role": "user", "content": "Hello"}]
# )

# 新代码 - 标准对话(对应原deepseek-chat)
response = client.chat.completions.create(
    model="deepseek-v4-flash",  # 替换模型名
    messages=[{"role": "user", "content": "Hello"}],
    temperature=0.7  # 非Thinking模式下仍然有效
)

# 新代码 - 深度思考(对应原deepseek-reasoner)
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "证明根号2是无理数"}],
    extra_body={"mode": "thinking"}  # 开启Thinking模式
    # 注意:Thinking模式下temperature/top_p/frequency_penalty失效
)

# 处理streaming中的reasoning_content
for chunk in client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Hello"}],
    stream=True,
    extra_body={"mode": "thinking"}
):
    if hasattr(chunk.choices[0].delta, 'reasoning_content'):
        # 思考过程(可选展示)
        print(f"[思考] {chunk.choices[0].delta.reasoning_content}", end="")
    if chunk.choices[0].delta.content:
        # 正式回答
        print(chunk.choices[0].delta.content, end="")

5.5 迁移检查清单

  • 全局搜索代码中的deepseek-chatdeepseek-reasoner
  • 替换为对应的V4模型名
  • 检查Thinking模式下的参数兼容性(temperature/top_p失效)
  • 更新streaming响应解析逻辑(处理reasoning_content字段)
  • 如果用extra_body={"mode": "thinking"},确认SDK版本支持自定义参数
  • 在测试环境完成回归测试(重点验证:响应格式、Token消耗、延迟变化)
  • 评估Token消耗变化对预算的影响(Thinking模式消耗可能不同)
  • 7月24日前完成生产环境部署

六、写在最后

DeepSeek V4满血版的意义,不只是"又便宜了"。

它证明了一件事:前沿模型的性能和成本之间的等式,是可以被重新书写的

178倍的价差不是营销噱头,是架构创新的直接结果——推理算力降至V3.2的27%、KV缓存降至10%,让同样的GPU资源产出更多Token。峰谷计费不是涨价,是把选择权交给用户:你对延迟敏感就高峰调用,你能等就用平峰拿到更低价格。

对于开发者,V4给出的决策逻辑很简单:

  • 追求绝对精度、不计成本:Claude Fable 5 / Opus 4.8
  • 追求性价比、高频生产环境:V4 Pro
  • 轻量级任务、成本极度敏感:V4 Flash

无论哪种选择,都比半年前便宜了一个数量级。

而比选择模型更重要的,是选择一种更高效的模型使用方式——统一接入多模型、按峰谷智能调度、缓存自动优化、故障无缝切换。这些工程层面的能力,决定了你在模型价格已经极低的时代,还能再省下多少。


  • 小程序:点点词元
  • 模型广场:https://activity.ldzktoken.com
  • API 文档:https://docs.ldzktoken.com
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐