GPT-6 Astra 发布拆解:官方跑分、第三方指数与定价,三张表对不上
·
一、先看三张对不上的表
表 A:OpenAI 官方口径(自测,未独立验证)
| 基准 | GPT-6 Astra | 对比对象 |
|---|---|---|
| FrontierMath T4 v2 | 97.6% | Claude Fable 5.1:87.8% |
| GPQA Diamond | 96.0% | Gemini 3.8 Flash:95.3% |
| Terminal-Bench Science 0.1 | 64.6% | Fable 5.1:52.6% |
| DeepSWE v1.1(编程 Agent) | 74.1% | Opus 5:73.7% |
| ARC-AGI-3 | 98.6%* | Opus 5:30.2% |
| ExploitBench(网络安全) | 100%* | Opus 5:70% |
*脚注说明:ARC-AGI-3 改了两个 harness 设置;ExploitBench 带"可能污染"警告。
表 B:第三方 Artificial Analysis
| 指标 | Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| 智能指数 | 61.2 | 65.7 | 63.1 |
| 编程 Agent 指数 | 67.0 | 67.2 | 68.1 |
| HLE(带工具) | 57.2% | 65.0% | — |
表 C:定价(每百万 token)
| 模型 | 输入/输出 | 备注 |
|---|---|---|
| GPT-6 Astra | $10 / $50 | Fast 模式价格翻倍 |
| GPT-5.6 Sol | $4 / $20 | 促销价,延续至 11/21 |
| Claude Fable 5.1 | $10 / $50 | 缓存读取降 75% |
二、为什么官方和第三方差这么多
三个原因,都是评测方法问题,不是阴谋论:
- 谁出题谁考:官方基准分数全部出自 OpenAI 自己的测试,对比图里对手的分数也是 OpenAI 测的,且排除了部分竞品项
- 口径选择:官方重点展示的是 Astra 领先幅度最大的数学、科研、安全项;编程、知识工作这些打平或落后的项没进主图
- 成本算法不同:OpenAI 按"单任务预估 API 成本"算,宣称比 Fable 5.1 省 63%;第三方按实际 token 消耗算,token 减少 10% 但单价涨 150%,单任务成本反而比 Sol 高约 75%
三、定价才是这次发布最硬的信号
Astra 把标准价定在 $10/$50,跟 Claude Fable 5.1 完全同价,同时 Sol 还挂着 $4/$20 的促销价(到 11/21)。这个组合说明三件事:
- OpenAI 一边冲"最强模型"叙事,一边不敢放弃价格战——旗舰涨价 150%,但用促销款承接价格敏感流量
- 定价锚点直接对标 Anthropic,两家旗舰 API 价格首次完全一致,选型时价格不再是区分因素
- 缓存读取 $1/百万、上下文窗口 105 万 token,是在为 Agent 长会话场景铺路
四、安全分级决定了分发节奏
Astra 达到自家 Preparedness Framework 的网络安全 Critical 阈值,加上 7 月两个测试模型卷入 Hugging Face 安全事件的前科,OpenAI 这次把安全放在了分发前面:
- 首发对象:Daybreak 网络安全项目合作企业
- 第二波:ChatGPT Plus/Pro/Business/Enterprise(“未来数日”)
- 免费档与最低付费档不在首发范围
System Card 里还有一句值得企业关注:Astra 的可监控性相比 Sol 下降,理论上可能规避思维链监控。对安全要求高的企业,这属于上线前要评估的隐性风险。
五、选型的避坑建议
- 别拿官方对比图做采购依据,等 LMArena、Artificial Analysis 的独立复测
- 按任务类型选:数学/科研/安全类优先 Astra;通用 Agent、知识工作类两边差距不大,用价格和缓存策略决定
- 成本按"单任务"算,别按单价算:token 效率差异可能抵消单价差异
- 关注安全条款:Critical 阈值模型的分发限制、数据留存条款,法务要提前介入
总结
三张表对不上的原因,是官方在展示"领先最大的赛道",第三方在反映"整体水平"。对企业来说,跑分只是入场券,任务匹配度和真实成本才是决策依据。
更多推荐


所有评论(0)