—— V4 预览版 vs 正式版(0813)全维度基准对比与性价比拆解

发布时间:2026-08-13 | 作者:AI 前线 | 分类:大模型 / 技术解读

图 1|DeepSeek V4 Pro 正式版发布(配图由 AI 生成)

8 月 12 日深夜,DeepSeek 在没有任何发布会、没有公众号推文的情况下,悄悄把官网 API 文档里的模型版本从预览版更新为 DeepSeek-V4-Pro-0813,调用名 deepseek-v4-pro 保持不变。这意味着从今年 4 月就以预览版身份运行的旗舰模型,终于正式“转正”。

本次更新的最大看点不是参数,而是 Agent(智能体)能力的质变:多项长周期编程与工具调用基准较预览版实现 4~5 倍跃升,并在 Terminal Bench 2.1 等核心指标上逼近甚至反超 Anthropic 的顶级闭源旗舰 Claude Fable 5,而价格却仅为其约 2%。本文基于官方公布的基准数据与多家媒体报道,为你梳理 V4 预览版到正式版的完整对比。

一、核心配置:1.6T MoE,原生 1M 上下文

  1. 架构与规模:
  2. 采用 MoE(混合专家)架构,总参数量约 1.6 万亿,每次推理仅激活约 490 亿参数;
  3. 上下文窗口原生 100 万 Token,单次最大输出长度达 38.4 万 Token;
  4. 支持“思考 / 非思考”双模式,并新增普通、高推理、最高推理三档推理强度(reasoning_effort:none / high / max);
  5. 接口侧支持 JSON Output、Tool Calls、OpenAI Responses API 以及 Anthropic API 双协议,可无缝接入 Codex、Claude Code 等现有工作流。

二、预览版 → 正式版:Agent 能力的质变

先看 DeepSeek 自己跟自己比。从预览版到正式版,十项 Agent 基准没有一项倒退,其中软件工程基准 DeepSWE 从 12.8 分暴涨到 62.7,提升近 5 倍,从“基本不会做”直接迈入全球第一梯队。

基准测试

预览版

正式版 0813

变化

Terminal Bench 2.1(终端自主操作)

72.1

87.9

+15.8

DeepSWE(软件工程)

12.8

62.7

+49.9 (≈4.9×)

CyberGym(AI 安全攻防)

52.7

83.3

+30.6

AutomationBench(自动化)

12.8

31.8

+19.0 (≈2.5×)

DSBench-FullStack

41.8

71.1

+29.3

DSBench-Hard

31.1

67.2

+36.1 (≈2.2×)

HLE(带工具)

48.2

60.0

+11.8

LiveCodeBench

93.5

新披露

Codeforces 评分

3206

接近顶级人类程序员

结论:V4 Pro 正式版不是一次微调,而是在 Agent 能力上完成了一次结构性跃升。尤其 DeepSWE 与 CyberGym 的涨幅,说明其在长周期、多步骤任务上的稳定性显著改善。

图 2|国产开源模型与全球顶级闭源模型首次站上同一起跑线(配图由 AI 生成)

三、横向对比:直面 Fable 5 与 Opus 4.8

将其放到更大的坐标系里——对阵 Anthropic 最新旗舰 Claude Fable 5 与 Opus 4.8:

基准测试

V4 Pro 0813

Claude Fable 5

Opus 4.8

对比结论

Terminal Bench 2.1

87.9

88.0

85.0

仅差 0.1,逼近

CyberGym (AI 安全)

83.3

83.1

78.3

反超 Fable 5

DeepSWE(软件工程)

62.7

70.0

58.0

超 Opus,逊于 Fable

HLE(带工具)

60.0

63.0

仅次于 Fable 5

DSBench-FullStack

71.1

77.2

仍有差距

NL2Repo(代码库)

61.5

69.7

逊于 Opus

注:上述分数为 DeepSeek 官方在自己 harness 框架下测得,Fable 5 取值多来自官方对比图(含 w/ fallback 口径),第三方完整复现仍有待验证。

在 Humanity's Last Exam(HLE)等纯推理项目上,V4 Pro 仍落后 Fable 5 约 10.6 个百分点;但去掉差距最大的一项后,其余 9 项平均仅落后 2.8%,且有 2 项实现反超。这是国产开源权重模型第一次站到全球顶级闭源模型的同一水平线上。

四、价格屠夫:分数差 0.1,价格差 57 倍

性能逼近的同时,价格依旧是 DeepSeek 的“降维打击”。以每百万 Token 计:

计费项(每百万 Token)

V4 Flash

V4 Pro 0813

Claude Fable 5

Kimi K3

输入(缓存命中)

¥0.008

¥0.025

输入(缓存未命中)

¥1

¥3

≈¥72 ($10)

输出

¥2

¥6

≈¥360 ($50)

≈¥100

并发上限

2500

500

  1. V4 Pro 定价正好是 V4 Flash 的 3 倍,延续“Flash 跑量、Pro 攻坚”的双轨制分工;
  2. 在 Terminal Bench 上跻身同一梯队,Fable 5 输出价约 $50/M,V4 Pro 仅 ¥6/M,分数差 0.1、价格差约 57 倍;
  3. 有机构测算:用 Claude Fable 5 完成一个基准任务约 $3.15,用 V4 Flash 仅需约 $0.03,差约 100 倍。

之所以能把价格压到这个量级,关键在于架构:V4 Pro 采用压缩稀疏注意力(CSA)与重度压缩注意力(HCA)两种变体,宣称将单 Token 推理计算量降至 V3.2 代的 27%、KV 缓存降至 10%,在 1M 上下文窗口下节省的成本极为可观。

五、同夜开卷:Grok 4.6 也来了

V4 Pro 转正当晚,xAI 也发布了 Grok 4.6(约 1.5T MoE,上下文 500K,定价 $2/$6 每百万 Token)。两者撞在同一晚,但定位不同:

  1. DeepSeek:更便宜(¥3 vs $2)、开源在即(MIT 许可证)、1M 上下文、编码 / Agent 更强;
  2. Grok 4.6:闭源、500K 上下文,知识工作类任务(GDPVal、Harvey LAB 等)冲到第一梯队,但深度编码稍弱。

简言之,两者并非直接对手:想白嫖开源 + 编码,蹲 DeepSeek 权重;想试知识工作天花板,可薅 Grok 首周羊毛。

六、怎么接:零代码改动切过来

V4 Pro 正式版同时兼容 OpenAI 与 Anthropic 两套协议,现有 Claude Code、Codex 工作流只需切换 base_url 与 api_key 即可测试,代码零改动。

1) OpenAI Responses API(新增)

from openai import OpenAI client = OpenAI(api_key="你的 DeepSeek Key", base_url="https://api.deepseek.com/v1") r = client.responses.create(model="deepseek-v4-pro", input="分析这段代码并生成测试用例") print(r.output_text)

2) Anthropic 协议(新增)

import anthropic client = anthropic.Anthropic(api_key="你的 DeepSeek Key", base_url="https://api.deepseek.com") m = client.messages.create(model="deepseek-v4-pro", max_tokens=4096, messages=[{"role":"user","content":"分析这段代码并生成测试用例"}]) print(m.content[0].text)

七、冷静看待:三个必须说清的槽点

  1. 自报口径:
  2. 跑分全是 DeepSeek 自家 harness 测得,目前无第三方完整复现;OpenRouter 援引 Artificial Analysis 的综合智能指数仅给 45.3 分,评级“优于 70% 的模型”,与官方叙事存在温差。
  3. “自家考题”公允性:
  4. DSBench 系列题目与验证器均未公开,属于内部测试集,横向可比性存疑。
  5. 长链路稳定性:
  6. 社区反馈显示,长时间连续执行时会出现提前停止、反复思考、任务质量不稳定的情况;部分用户还观察到思维链出现“山顶洞语”(语法碎裂但语义尚存),疑似为压缩 Token 消耗的取舍。

所以“逼近 Fable 5”这句话,建议打八折听——价格是白纸黑字骗不了人,能力得自己上手验。笔者的习惯:先拿它跑一周自己项目的真实任务,再决定是否上生产。

八、小结与行动建议

  1. 值得关注:
  2. V4 Pro 正式版在 Agent / 编码场景的质变是真实的,且价格极具侵略性;
  3. V4 Flash 负责高频轻量、Pro 负责复杂攻坚,可按场景搭配;
  4. 官方已预告“近期将大幅上调 API 定价”,当前低价窗口期建议有量需求者尽早锁定。

参考资料:DeepSeek 官方 API 文档与定价页、SemiAnalysis、经济观察报、DeepTech 深科技、36 氪、CSDN、掘金等公开报道(截至 2026-08-13)。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐