一、先看三张对不上的表

表 A:OpenAI 官方口径(自测,未独立验证)

基准GPT-6 Astra对比对象
FrontierMath T4 v297.6%Claude Fable 5.1:87.8%
GPQA Diamond96.0%Gemini 3.8 Flash:95.3%
Terminal-Bench Science 0.164.6%Fable 5.1:52.6%
DeepSWE v1.1(编程 Agent)74.1%Opus 5:73.7%
ARC-AGI-398.6%*Opus 5:30.2%
ExploitBench(网络安全)100%*Opus 5:70%

*脚注说明:ARC-AGI-3 改了两个 harness 设置;ExploitBench 带"可能污染"警告。

表 B:第三方 Artificial Analysis

指标AstraClaude Fable 5.1Claude Opus 5
智能指数61.265.763.1
编程 Agent 指数67.067.268.1
HLE(带工具)57.2%65.0%—

表 C:定价(每百万 token)

模型输入/输出备注
GPT-6 Astra$10 / $50Fast 模式价格翻倍
GPT-5.6 Sol$4 / $20促销价,延续至 11/21
Claude Fable 5.1$10 / $50缓存读取降 75%

二、为什么官方和第三方差这么多

三个原因,都是评测方法问题,不是阴谋论:

  1. 谁出题谁考:官方基准分数全部出自 OpenAI 自己的测试,对比图里对手的分数也是 OpenAI 测的,且排除了部分竞品项
  2. 口径选择:官方重点展示的是 Astra 领先幅度最大的数学、科研、安全项;编程、知识工作这些打平或落后的项没进主图
  3. 成本算法不同:OpenAI 按"单任务预估 API 成本"算,宣称比 Fable 5.1 省 63%;第三方按实际 token 消耗算,token 减少 10% 但单价涨 150%,单任务成本反而比 Sol 高约 75%

三、定价才是这次发布最硬的信号

Astra 把标准价定在 $10/$50,跟 Claude Fable 5.1 完全同价,同时 Sol 还挂着 $4/$20 的促销价(到 11/21)。这个组合说明三件事:

  • OpenAI 一边冲"最强模型"叙事,一边不敢放弃价格战——旗舰涨价 150%,但用促销款承接价格敏感流量
  • 定价锚点直接对标 Anthropic,两家旗舰 API 价格首次完全一致,选型时价格不再是区分因素
  • 缓存读取 $1/百万、上下文窗口 105 万 token,是在为 Agent 长会话场景铺路

四、安全分级决定了分发节奏

Astra 达到自家 Preparedness Framework 的网络安全 Critical 阈值,加上 7 月两个测试模型卷入 Hugging Face 安全事件的前科,OpenAI 这次把安全放在了分发前面:

  • 首发对象:Daybreak 网络安全项目合作企业
  • 第二波:ChatGPT Plus/Pro/Business/Enterprise(“未来数日”)
  • 免费档与最低付费档不在首发范围

System Card 里还有一句值得企业关注:Astra 的可监控性相比 Sol 下降,理论上可能规避思维链监控。对安全要求高的企业,这属于上线前要评估的隐性风险。

五、选型的避坑建议

  1. 别拿官方对比图做采购依据,等 LMArena、Artificial Analysis 的独立复测
  2. 按任务类型选:数学/科研/安全类优先 Astra;通用 Agent、知识工作类两边差距不大,用价格和缓存策略决定
  3. 成本按"单任务"算,别按单价算:token 效率差异可能抵消单价差异
  4. 关注安全条款:Critical 阈值模型的分发限制、数据留存条款,法务要提前介入

总结

三张表对不上的原因,是官方在展示"领先最大的赛道",第三方在反映"整体水平"。对企业来说,跑分只是入场券,任务匹配度和真实成本才是决策依据。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐