OpenAI发布GPT-6 Astra:ARC-AGI 3得分99.9%,API定价对标Claude Fable 5
GPT-6 Astra今日起向部分组织开放,未来数日将覆盖全部ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API和AWS提供。API定价为每百万输入tokens 10美元、每百万输出tokens 50美元,与Claude Fable 5和5.1相同。
OpenAI于2026年9月3日发布GPT-6 Astra,今日起向部分组织开放,未来数日将覆盖所有ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API和AWS提供,API模型标识为gpt-6-astra。
模型API定价为每百万输入tokens 10美元、每百万输出tokens 50美元,与Claude Fable 5和5.1相同。
基准表现:自报高分为主,独立评测有保留
OpenAI自报基准显示,Astra在大多数测试中得分高于Fable,包括ARC-AGI 3上获得99.9%,但ARC-AGI博客注明,该成绩是在OpenAI定制Provider Adapter harness下花费1.9万美元取得,默认测试框架下得分62.7%,花费2.6万美元。Provider Adapter harness可在请求间保留不透明的推理状态,并对长对话使用压缩技术,使模型复用先前工作。
在安全任务上,Astra在ExploitBench得分100%(GPT-5.6 Sol为78.5%),ExploitGym得分42.4%(Sol为30.3%),SRE-Bench二进制逆向工程四次尝试内成功率99.2%(Sol为68.7%)。
长上下文方面,OpenAI的八针基准测试中,Astra在256K至512K token范围准确率100%,512K至1M token范围96.3%。
独立评测机构Artificial Analysis指出,Astra的智能指数与GPT-5.6 Sol持平(61分),比Claude Fable 5.1最高分低5分,也落后于Meta新发布的Muse Spark 1.3最高分。
- ARC-AGI 3:99.9%(自定义harness,成本1.9万美元);默认harness为62.7%(成本2.6万美元)
- ExploitBench:100%(Sol为78.5%)
- ExploitGym:42.4%(Sol为30.3%)
- SRE-Bench:99.2%(Sol为68.7%)
- 八针基准:256K-512K tokens准确率100%,512K-1M tokens准确率96.3%
成本效率:编码代理指数领先
在Artificial Analysis的编码代理指数中,Astra在最高努力水平下成本与GPT-5.6 Sol相当,但得分高2分;每个任务成本不到Claude Fable 5的一半,在相同得分下。