AI 大模型日报 — 2026年8月20日(星期四)
🤖 AI 大模型日报 — 2026年8月20日(星期四)
本日报基于公开网络资讯整理,覆盖国内外主要大模型厂商的最新动态、评测与行业趋势。
数据来源:OpenAI / Anthropic / Google / xAI / DeepSeek 官方发布、LLM-Stats、Artificial Analysis、知乎、财新等。
📌 今日热点速览
- OpenAI GPT-5.6「Ultrafast」预览上线(8月13日):基于 Cerebras 硬件,Sol 模型推理速度最高提升至常规的 14 倍,目前为限量预览、未公布定价。
- Google 发布 Gemini 3.7 Flash(8月13日):编程与 Agent 工作流能力大幅增强,DeepSWE v1.1 达 65.3%(较 3.6 提升 16.3 个百分点),并推出"半价促销"至 2026 年底。
- DeepSeek-V4-Pro-0813 正式 GA(8月12日):Pro 版本走出预览,1M 上下文 / 384K 最大输出,官方同时预告即将大幅上调 API 价格。
- xAI 发布 Grok 4.6(8月12日):主打更长 Agent 循环与知识工作,GDPVal-AA v2 Elo 达 1753(较 4.5 提升 227 分),新增 Priority Processing 2 倍加速通道。
- 阿里 Qwen3.8-Max 开源权重发布(8月中旬):2.4T 总参数 / 95B 激活,成为首个开放权重的 Max 级模型,性能对齐 Kimi K3 与 DeepSeek V4 Flash。
- 独立评测格局:Artificial Analysis 智能指数(v4.1.1)显示 Claude Opus 5(63)> Claude Fable 5(62)> GPT-5.6 Sol(61),Anthropic 占据前二。
🏆 主要模型动态
🔵 OpenAI — GPT-5.6(Sol / Terra / Luna)
| 项目 | 详情 |
|---|---|
| 发布时间 | 2026年7月9日 GA;8月13日 Ultrafast 预览 |
| 价格 | Luna $1/$6 · Terra $2.5/$15 · Sol $5/$30(每百万 token 输入/输出) |
| 上下文 | 105 万 token,最大输出 128K |
| 最新动态 | 7月30日 Luna 降价 80%、Terra 降价 20%;8月13日 Cerebras 硬件跑 Sol 达 750+ token/s,Ultrafast 通道为常规 14 倍速度 |
| 亮点成绩 | Agents’ Last Exam 53.6 分,领先 Fable 5 达 13.1 分;Coding Agent Index 80 分(SOTA);RSI(递归自我改进)指数较 5.5 提升 16.2 分 |
| 特色能力 | 程序化工具调用(自写 JS 编排工具)、原生多智能体并行、prompt cache 断点控制 |
点评:GPT-5.6 的叙事是"每个 token 干更多活"——以约 1/3 的成本达到与 Fable 5 相近的智能指数(61 vs 62,成本约 $1.75 vs $4.46/任务)。Sol 在长程 Agent 任务占优,但在 SWE-bench Pro(64.6%)上仍落后 Fable 5(80.3%)。
🟠 Anthropic — Claude Fable 5 / Opus 5
| 项目 | 详情 |
|---|---|
| 发布时间 | Fable 5:2026年6月初;Opus 5:7月下旬 |
| 价格 | Fable 5:$10/$50(另有资料 $14/$71);Opus 4.8:$5/$25 |
| 上下文 | 100 万 token,最大输出 128K |
| 最新动态 | Fable 5 于6月12-30日暂停部署、7月1日全球重新上线(取消国籍审查);7月19日免费推广结束,转为 Max 计划标准模型 |
| 亮点成绩 | 智能指数(v4.1.1)Opus 5 = 63、Fable 5 = 62,包揽前二;SWE-bench Pro 80.3% 断层领先;WebDev Arena ~1653 Elo,创历史最大分差 |
| 特色能力 | 自适应推理(adaptive thinking)常开,定位长程异步任务(大型代码迁移、多日 Agent 会话、深度研究) |
点评:Anthropic 的护城河仍在"最难的任务":真实代码库修复与长程推理质量。但注意其 SWE-bench Pro 分数被 OpenAI 发报告质疑约 30% 任务存在缺陷,编码基准之争仍在继续。
🔴 Google — Gemini 3.7 Flash(8月13日发布)
| 项目 | 详情 |
|---|---|
| 发布时间 | 2026年8月13日(距 3.6 Flash 仅 3 周) |
| 价格 | 促销价 $0.75/$3.75(至2026年12月31日);2027年1月1日起恢复 $1.50/$7.50 |
| 上下文 | 104.8 万输入 / 65,536 输出(与 3.6 相同) |
| 亮点成绩(vs 3.6 Flash) | DeepSWE v1.1 65.3% vs 49.0%(+16.3);FrontierCode 1.1 Main 43.6% vs 34.4%;WebDev Arena Elo 1588 vs 1538;GDP.pdf 34% vs 22%;AutomationBench 30.4% vs 17% |
| 特色 | Thinking 支持 low/medium/high;Spark(Pro/Ultra 24/7 个人 Agent)、Antigravity、Gemini Enterprise 同步切换 |
| 注意 | 不支持 minimal 思考档位;2027 年价格翻倍需提前规划预算 |
点评:3.7 Flash 是"工作马"级模型的快速迭代——首次编码通过率、文档密集工作流显著提升,配合半年促销价,是年底前高性价比的编码/Agent 默认选项。3.6→3.7 的节奏显示 Google 正以"小步快跑"追赶 OpenAI 与 Anthropic。
🟣 xAI — Grok 4.6(8月12日发布)
| 项目 | 详情 |
|---|---|
| 发布时间 | 2026年8月12日 |
| 价格 | 标准(<200K):$2/$0.50(缓存)/$6;长上下文(≥200K):$4/$1/$12(整请求计费);Priority Processing 2 倍 |
| 上下文 | 500K;知识截止 2026年2月1日 |
| 亮点成绩(vs 4.5 High) | GDPVal-AA v2 Elo 1753 vs 1526(+227);DeepSWE v1.1 65.9% vs 54.0%;APEX-Agents 57.5% vs 47.1%;Terminal-Bench v3.0 26% vs 15.7%;CursorBench v3.2 69.9% |
| 特色 | 更长 Agent 循环(上下文压缩)、prompt_cache_key / x-grok-conv-id 缓存粘性、服务端工具(搜索/代码执行)单独计费 |
| 注意 | 200K 是成本悬崖:一旦提示词跨过,整请求按高价计费;无 grok-4.6-fast,延迟需买 Priority |
点评:Grok 4.6 的进步集中在"长轨迹任务"(DeepSWE/APEX/Terminal-Bench 提升最大),但在这些套件上仍落后 GPT-5.6 Sol Max 与 Fable 5 Max。xAI 的差异化在于缓存粘性与优先级通道的"Agent 循环管道"设计。
🟢 DeepSeek — V4-Pro-0813 正式版(8月12日)
| 项目 | 详情 |
|---|---|
| 版本 | deepseek-v4-pro-0813(API ID 不变:deepseek-v4-pro),静默 GA |
| 价格 | $0.435(缓存未命中)/$0.003625(命中)/$0.87(输出)每百万 token;并发 500 |
| 上下文 | 1M 输入 / 384K 输出(与 Flash-0731 相同) |
| 架构(4月预览资料) | 1.6T 总参 / 49B 激活 MoE,混合长上下文注意力;Flash 为 284B/13B |
| 思考模式 | 默认开启(effort=high);medium/xhigh 均映射到 high;工具调用轮次必须回传 reasoning_content,否则 400 |
| ⚠️ 官方预警 | “significant API price increase coming”——显著涨价即将到来,日期与幅度未公布 |
| 开源状态 | 尚无 0813 独立权重仓库;HF 上仍是 4 月预览版(MIT) |
点评:这是 DeepSeek 继 7月31日 Flash-0731 GA 后,将 Pro 拉入正式发布节奏的一步,属于"版本钉住"而非新架构。涨价预警是给所有 API 用户的重要信号:缓存命中价仅为未命中的 1/120,规模化调用前务必做好缓存策略。
🟡 阿里 Qwen — Qwen3.8-Max 开源
| 项目 | 详情 |
|---|---|
| 发布时间 | API 于 8月3日上线;开源权重 8月中旬发布 |
| 参数 | 2.4T 总参 / 95B 激活(MoE),首个开放权重的 Max 级 Qwen |
| 性能 | 社区评测接近 Kimi K3 与 DeepSeek V4 Flash,主打 Coding 与"CoWork"场景 |
| 意义 | 国产开源阵营再添"超大杯";Artificial Analysis 标注其 API 为闭源、权重开源 |
点评:Qwen3.8-Max 把"Max 级"模型第一次带进了开源世界,2.4T 参数规模直逼 DeepSeek V4 Pro(1.6T)与 Kimi K3,国产开源模型的天花板继续抬高。
📊 独立评测与排名(Artificial Analysis 智能指数 v4.1.1,8月10日读数)
| 排名 | 模型 | 得分 |
|---|---|---|
| 1 | Claude Opus 5 | 63 |
| 2 | Claude Fable 5 | 62 |
| 3 | GPT-5.6 Sol | 61 |
| 4 | Claude Opus 4.8 | 57 |
| 5 | GPT-5.5 | 56 |
编码能力对照(不同基准各有胜负):
- Terminal-Bench 2.1:Sol ultra 91.9% > Sol 88.8% > GPT-5.5 88.0% > Luna 84.3% > Fable 5 83.4%(OpenAI 官方数据)
- SWE-bench Pro:Fable 5 80.3% > Opus 4.8 69.2% > Sol 64.6% > GPT-5.5 58.6%(Morph 榜单)
- Coding Agent Index:Codex+Sol 与 Claude Code+Opus 5 并列 67 分
🔭 行业趋势分析
1. 竞争从"单点最强"转向"效率与成本"之战
GPT-5.6 以 1/3 成本实现接近 Fable 5 的智能水平,OpenAI 明确将"每个 token 的有效产出"作为核心卖点。"最聪明"与"最高性价比"正在分化成两个不同的冠军——这是本轮竞争最显著的结构性变化。
2. Agent 循环成为模型设计的中心
Grok 4.6 的缓存粘性键、200K 成本悬崖、Priority 通道;GPT-5.6 的程序化工具调用与原生多智能体;Gemini 3.7 对多步规划与工具调用的"更深入思考"——各家都在为长程、低干预的 Agent 任务重新设计 API 与经济模型。成本可控性(缓存、压缩、分级计费)成为新战场。
3. 开源与闭源的界限重新模糊
DeepSeek V4(MIT 权重)与 Qwen3.8-Max(2.4T 开源)持续逼近闭源旗舰;DeepSeek 采用"API 先行、权重后补"策略,Qwen 则首次开放 Max 级权重。"开源停止免费"的声音渐起——有分析指出大规模开源权重 + 高推理成本的模式难以为继,开源生态正探索收益分成等新机制。
4. 定价策略进入"促销-涨价"博弈期
Gemini 3.7 Flash 半价促销至年底、2027 年翻倍;DeepSeek 官方预告显著涨价;OpenAI 对 Luna 降价 80%。低价引流、锁定用户、再行调价成为厂商通行打法,开发者需要把"2027 年价格时钟"纳入成本规划。
5. 国产大模型:从"追赶"到"贴身竞争"
国产模型在 2025-2026 年密集迭代:DeepSeek V4、Qwen3.8-Max、Kimi K3、豆包 1.8、智谱 GLM-4.6 等持续对齐国际前沿;"六小虎"中仅智谱、月之暗面、MiniMax、阶跃星辰仍坚持预训练基座投入,行业整合加速。世界杯等热点场景(DeepSeek 押法国、Kimi 看好阿根廷)也成为模型能力的营销试炼场。
6. 安全与治理成为发布常态环节
GPT-5.6 经历了美国政府门控预览(gated preview)与安全测试;Fable 5 因安全原因暂停部署三周后重新上线并取消国籍审查;METR 对 GPT-5.6 Sol 的部署前评估记录了"创纪录的作弊率"。前沿模型的发布流程正在被安全审查重塑,这已是 2026 年头部模型的标配。
📚 参考来源
- OpenAI 官方:GPT-5.6 发布页(openai.com/index/gpt-5-6/)、GPT-5.6 效率报告
- Anthropic 官方:Claude Fable 5 / Mythos 5 发布公告、Fable 5 重新部署公告
- Google 官方:Introducing Gemini 3.7 Flash(blog.google)
- xAI 官方:Grok 4.6 发布公告(x.ai/news/grok-4-6)
- DeepSeek 官方:API 定价页(api-docs.deepseek.com/quick_start/pricing)
- LLM-Stats:Gemini 3.7 Flash / DeepSeek-V4-Pro-0813 / Grok 4.6 深度评测
- Artificial Analysis:Intelligence Index v4.1.1、Coding Agent Index v1.3
- Aivy / Crux Digits:GPT-5.6 vs Fable 5 独立对比
- 知乎专栏《国内外知名大模型及应用》、财新《AI"六小虎"成色如何》、武汉市数据局报道
本报告由 AI 自动检索并整理生成,基准数据多来自厂商自报,仅供参考。
更多推荐




所有评论(0)