🤖 AI 大模型日报 — 2026年8月20日(星期四)

本日报基于公开网络资讯整理,覆盖国内外主要大模型厂商的最新动态、评测与行业趋势。
数据来源:OpenAI / Anthropic / Google / xAI / DeepSeek 官方发布、LLM-Stats、Artificial Analysis、知乎、财新等。


📌 今日热点速览

  1. OpenAI GPT-5.6「Ultrafast」预览上线(8月13日):基于 Cerebras 硬件,Sol 模型推理速度最高提升至常规的 14 倍,目前为限量预览、未公布定价。
  2. Google 发布 Gemini 3.7 Flash(8月13日):编程与 Agent 工作流能力大幅增强,DeepSWE v1.1 达 65.3%(较 3.6 提升 16.3 个百分点),并推出"半价促销"至 2026 年底。
  3. DeepSeek-V4-Pro-0813 正式 GA(8月12日):Pro 版本走出预览,1M 上下文 / 384K 最大输出,官方同时预告即将大幅上调 API 价格
  4. xAI 发布 Grok 4.6(8月12日):主打更长 Agent 循环与知识工作,GDPVal-AA v2 Elo 达 1753(较 4.5 提升 227 分),新增 Priority Processing 2 倍加速通道。
  5. 阿里 Qwen3.8-Max 开源权重发布(8月中旬):2.4T 总参数 / 95B 激活,成为首个开放权重的 Max 级模型,性能对齐 Kimi K3 与 DeepSeek V4 Flash。
  6. 独立评测格局:Artificial Analysis 智能指数(v4.1.1)显示 Claude Opus 5(63)> Claude Fable 5(62)> GPT-5.6 Sol(61),Anthropic 占据前二。

🏆 主要模型动态

🔵 OpenAI — GPT-5.6(Sol / Terra / Luna)

项目 详情
发布时间 2026年7月9日 GA;8月13日 Ultrafast 预览
价格 Luna $1/$6 · Terra $2.5/$15 · Sol $5/$30(每百万 token 输入/输出)
上下文 105 万 token,最大输出 128K
最新动态 7月30日 Luna 降价 80%、Terra 降价 20%;8月13日 Cerebras 硬件跑 Sol 达 750+ token/s,Ultrafast 通道为常规 14 倍速度
亮点成绩 Agents’ Last Exam 53.6 分,领先 Fable 5 达 13.1 分;Coding Agent Index 80 分(SOTA);RSI(递归自我改进)指数较 5.5 提升 16.2 分
特色能力 程序化工具调用(自写 JS 编排工具)、原生多智能体并行、prompt cache 断点控制

点评:GPT-5.6 的叙事是"每个 token 干更多活"——以约 1/3 的成本达到与 Fable 5 相近的智能指数(61 vs 62,成本约 $1.75 vs $4.46/任务)。Sol 在长程 Agent 任务占优,但在 SWE-bench Pro(64.6%)上仍落后 Fable 5(80.3%)。

🟠 Anthropic — Claude Fable 5 / Opus 5

项目 详情
发布时间 Fable 5:2026年6月初;Opus 5:7月下旬
价格 Fable 5:$10/$50(另有资料 $14/$71);Opus 4.8:$5/$25
上下文 100 万 token,最大输出 128K
最新动态 Fable 5 于6月12-30日暂停部署、7月1日全球重新上线(取消国籍审查);7月19日免费推广结束,转为 Max 计划标准模型
亮点成绩 智能指数(v4.1.1)Opus 5 = 63、Fable 5 = 62,包揽前二;SWE-bench Pro 80.3% 断层领先;WebDev Arena ~1653 Elo,创历史最大分差
特色能力 自适应推理(adaptive thinking)常开,定位长程异步任务(大型代码迁移、多日 Agent 会话、深度研究)

点评:Anthropic 的护城河仍在"最难的任务":真实代码库修复与长程推理质量。但注意其 SWE-bench Pro 分数被 OpenAI 发报告质疑约 30% 任务存在缺陷,编码基准之争仍在继续。

🔴 Google — Gemini 3.7 Flash(8月13日发布)

项目 详情
发布时间 2026年8月13日(距 3.6 Flash 仅 3 周)
价格 促销价 $0.75/$3.75(至2026年12月31日);2027年1月1日起恢复 $1.50/$7.50
上下文 104.8 万输入 / 65,536 输出(与 3.6 相同)
亮点成绩(vs 3.6 Flash) DeepSWE v1.1 65.3% vs 49.0%(+16.3);FrontierCode 1.1 Main 43.6% vs 34.4%;WebDev Arena Elo 1588 vs 1538;GDP.pdf 34% vs 22%;AutomationBench 30.4% vs 17%
特色 Thinking 支持 low/medium/high;Spark(Pro/Ultra 24/7 个人 Agent)、Antigravity、Gemini Enterprise 同步切换
注意 不支持 minimal 思考档位;2027 年价格翻倍需提前规划预算

点评:3.7 Flash 是"工作马"级模型的快速迭代——首次编码通过率、文档密集工作流显著提升,配合半年促销价,是年底前高性价比的编码/Agent 默认选项。3.6→3.7 的节奏显示 Google 正以"小步快跑"追赶 OpenAI 与 Anthropic。

🟣 xAI — Grok 4.6(8月12日发布)

项目 详情
发布时间 2026年8月12日
价格 标准(<200K):$2/$0.50(缓存)/$6;长上下文(≥200K):$4/$1/$12(整请求计费);Priority Processing 2 倍
上下文 500K;知识截止 2026年2月1日
亮点成绩(vs 4.5 High) GDPVal-AA v2 Elo 1753 vs 1526(+227);DeepSWE v1.1 65.9% vs 54.0%;APEX-Agents 57.5% vs 47.1%;Terminal-Bench v3.0 26% vs 15.7%;CursorBench v3.2 69.9%
特色 更长 Agent 循环(上下文压缩)、prompt_cache_key / x-grok-conv-id 缓存粘性、服务端工具(搜索/代码执行)单独计费
注意 200K 是成本悬崖:一旦提示词跨过,整请求按高价计费;无 grok-4.6-fast,延迟需买 Priority

点评:Grok 4.6 的进步集中在"长轨迹任务"(DeepSWE/APEX/Terminal-Bench 提升最大),但在这些套件上仍落后 GPT-5.6 Sol Max 与 Fable 5 Max。xAI 的差异化在于缓存粘性与优先级通道的"Agent 循环管道"设计。

🟢 DeepSeek — V4-Pro-0813 正式版(8月12日)

项目 详情
版本 deepseek-v4-pro-0813(API ID 不变:deepseek-v4-pro),静默 GA
价格 $0.435(缓存未命中)/$0.003625(命中)/$0.87(输出)每百万 token;并发 500
上下文 1M 输入 / 384K 输出(与 Flash-0731 相同)
架构(4月预览资料) 1.6T 总参 / 49B 激活 MoE,混合长上下文注意力;Flash 为 284B/13B
思考模式 默认开启(effort=high);medium/xhigh 均映射到 high;工具调用轮次必须回传 reasoning_content,否则 400
⚠️ 官方预警 “significant API price increase coming”——显著涨价即将到来,日期与幅度未公布
开源状态 尚无 0813 独立权重仓库;HF 上仍是 4 月预览版(MIT)

点评:这是 DeepSeek 继 7月31日 Flash-0731 GA 后,将 Pro 拉入正式发布节奏的一步,属于"版本钉住"而非新架构。涨价预警是给所有 API 用户的重要信号:缓存命中价仅为未命中的 1/120,规模化调用前务必做好缓存策略。

🟡 阿里 Qwen — Qwen3.8-Max 开源

项目 详情
发布时间 API 于 8月3日上线;开源权重 8月中旬发布
参数 2.4T 总参 / 95B 激活(MoE),首个开放权重的 Max 级 Qwen
性能 社区评测接近 Kimi K3 与 DeepSeek V4 Flash,主打 Coding 与"CoWork"场景
意义 国产开源阵营再添"超大杯";Artificial Analysis 标注其 API 为闭源、权重开源

点评:Qwen3.8-Max 把"Max 级"模型第一次带进了开源世界,2.4T 参数规模直逼 DeepSeek V4 Pro(1.6T)与 Kimi K3,国产开源模型的天花板继续抬高。


📊 独立评测与排名(Artificial Analysis 智能指数 v4.1.1,8月10日读数)

排名 模型 得分
1 Claude Opus 5 63
2 Claude Fable 5 62
3 GPT-5.6 Sol 61
4 Claude Opus 4.8 57
5 GPT-5.5 56

编码能力对照(不同基准各有胜负):

  • Terminal-Bench 2.1:Sol ultra 91.9% > Sol 88.8% > GPT-5.5 88.0% > Luna 84.3% > Fable 5 83.4%(OpenAI 官方数据)
  • SWE-bench Pro:Fable 5 80.3% > Opus 4.8 69.2% > Sol 64.6% > GPT-5.5 58.6%(Morph 榜单)
  • Coding Agent Index:Codex+Sol 与 Claude Code+Opus 5 并列 67 分

🔭 行业趋势分析

1. 竞争从"单点最强"转向"效率与成本"之战

GPT-5.6 以 1/3 成本实现接近 Fable 5 的智能水平,OpenAI 明确将"每个 token 的有效产出"作为核心卖点。"最聪明"与"最高性价比"正在分化成两个不同的冠军——这是本轮竞争最显著的结构性变化。

2. Agent 循环成为模型设计的中心

Grok 4.6 的缓存粘性键、200K 成本悬崖、Priority 通道;GPT-5.6 的程序化工具调用与原生多智能体;Gemini 3.7 对多步规划与工具调用的"更深入思考"——各家都在为长程、低干预的 Agent 任务重新设计 API 与经济模型。成本可控性(缓存、压缩、分级计费)成为新战场。

3. 开源与闭源的界限重新模糊

DeepSeek V4(MIT 权重)与 Qwen3.8-Max(2.4T 开源)持续逼近闭源旗舰;DeepSeek 采用"API 先行、权重后补"策略,Qwen 则首次开放 Max 级权重。"开源停止免费"的声音渐起——有分析指出大规模开源权重 + 高推理成本的模式难以为继,开源生态正探索收益分成等新机制。

4. 定价策略进入"促销-涨价"博弈期

Gemini 3.7 Flash 半价促销至年底、2027 年翻倍;DeepSeek 官方预告显著涨价;OpenAI 对 Luna 降价 80%。低价引流、锁定用户、再行调价成为厂商通行打法,开发者需要把"2027 年价格时钟"纳入成本规划。

5. 国产大模型:从"追赶"到"贴身竞争"

国产模型在 2025-2026 年密集迭代:DeepSeek V4、Qwen3.8-Max、Kimi K3、豆包 1.8、智谱 GLM-4.6 等持续对齐国际前沿;"六小虎"中仅智谱、月之暗面、MiniMax、阶跃星辰仍坚持预训练基座投入,行业整合加速。世界杯等热点场景(DeepSeek 押法国、Kimi 看好阿根廷)也成为模型能力的营销试炼场。

6. 安全与治理成为发布常态环节

GPT-5.6 经历了美国政府门控预览(gated preview)与安全测试;Fable 5 因安全原因暂停部署三周后重新上线并取消国籍审查;METR 对 GPT-5.6 Sol 的部署前评估记录了"创纪录的作弊率"。前沿模型的发布流程正在被安全审查重塑,这已是 2026 年头部模型的标配。


📚 参考来源

  • OpenAI 官方:GPT-5.6 发布页(openai.com/index/gpt-5-6/)、GPT-5.6 效率报告
  • Anthropic 官方:Claude Fable 5 / Mythos 5 发布公告、Fable 5 重新部署公告
  • Google 官方:Introducing Gemini 3.7 Flash(blog.google)
  • xAI 官方:Grok 4.6 发布公告(x.ai/news/grok-4-6)
  • DeepSeek 官方:API 定价页(api-docs.deepseek.com/quick_start/pricing)
  • LLM-Stats:Gemini 3.7 Flash / DeepSeek-V4-Pro-0813 / Grok 4.6 深度评测
  • Artificial Analysis:Intelligence Index v4.1.1、Coding Agent Index v1.3
  • Aivy / Crux Digits:GPT-5.6 vs Fable 5 独立对比
  • 知乎专栏《国内外知名大模型及应用》、财新《AI"六小虎"成色如何》、武汉市数据局报道

本报告由 AI 自动检索并整理生成,基准数据多来自厂商自报,仅供参考。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐