模型The Decoder AI·原文 2026年9月4日本站收录 2026年9月7日

OpenAI发布GPT-6 Astra,称其或已符合AGI定义,安全评级首次达到“严重”

OpenAI发布迄今最强模型GPT-6 Astra,总裁Greg Brockman称其可能已符合公司对AGI的定义。该模型是首个被OpenAI安全框架评为“严重”级别的模型,在测试中自主发现两个此前未知的零日漏洞。

AI解读:OpenAI这次发布GPT-6 Astra,最值得关注的不只是它跑分领先,而是安全定性变了:这是OpenAI第一次把自己家的模型评为“严重”风险等级,理由是它在没人逐步指挥的情况下,能自己找出软件里没人发现过的漏洞并利用。这和之前“能聊天、能写代码”的模型不是一类能力,监管和部署门槛会不一样。对普通用户来说,Astra会随ChatGPT订阅和API逐渐铺开,但最顶尖的网络安全功能只开放给受信任的防御方,所以日常使用暂时不需要担心或行动。对企业用户,真正的决策点是成本和能力的换算:Astra每token单价是Sol的2.5倍,但OpenAI给出的数据是在DeepSWE v1.1这类编码任务上,每个任务的API成本反而降了约57%。如果这个“每完成一个任务多少钱”的算法成立,那选模型就不是单看token价格,而是要拿自己真实的任务去测。需要提醒的是,OpenAI宣称的AGI和“能力超过人类”是在它自己的定义和部分自家测试条件下得出的,第三方还没有复现。

OpenAI于2026年发布GPT-6 Astra,官方称其为迄今最强模型。总裁Greg Brockman表示,该模型可能已符合公司对AGI的定义——即“在大多数有经济价值的工作上超越人类”的AI系统,或在可及范围内。Brockman在发布会上说:“欢迎来到AGI时代。(Welcome to the AGI era.)”

Astra首先通过OpenAI的Daybreak项目向部分组织开放,未来几天将向ChatGPT Plus、Pro、Business及Enterprise用户全面推出,同时通过API及AWS Bedrock、Microsoft Azure等云平台提供。Pro、Business和Enterprise订阅者可使用更高性能的GPT-6 Astra Pro版本,但企业工作区管理员需手动激活。

训练规模与前代对比

Astra在得克萨斯州Stargate设施中,使用超过10万块GPU完成预训练。OpenAI研究员Aidan Clark称这是公司史上最大规模的训练。他表示,从Sol到Astra的能力提升幅度大于从早期模型到Sol的提升,部分原因在于之前的AI模型参与了训练监控。

基准测试结果

OpenAI公布的基准测试显示,Astra得分大幅领先其前代GPT-5.6 Sol及Anthropic的Fable系列模型:逻辑推理ARC-AGI-3得分99.9%(在自家测试条件下);数学FrontierMath Tier 4 v2得分97.6%;软件工程DeepSWE v1.1得分74.1%;专家知识GPQA Diamond得分96%;工程BenchCAD得分95.9%;网络安全ExploitBench得分100%。

在计算机使用方面,Astra在OSWorld 2.0(离线、部分)得分为72.6%,每任务约40分钟,而Sol为65.7%,每任务约75分钟。OpenAI称:“你在电脑上能做的任何事,Astra都能为你做,而且快。”

安全评级与漏洞发现

Astra是首款被OpenAI Preparedness Framework评为“严重”(critical)级别的模型,意味着它能在无需人类逐步指导的情况下,发现未知漏洞并跨系统构建利用链。OpenAI承认,Astra的书面推理比GPT-5.6 Sol更难监控。

在评估期间,Astra发现了两个此前未知的零日漏洞,OpenAI已报告给相关供应商。人类专家确认,Astra能识别包括浏览器和操作系统在内的多种软件类别中的新型零日漏洞。最先进的网络安全能力目前仅限Daybreak Blue项目中的受信任防御方使用。

价格与Codex更新

API标准模式下,Astra定价为每百万输入token 10美元、每百万输出token 50美元。快速模式速度提升2.5倍,价格翻倍,使Astra比GPT-5.6 Sol贵2.5倍,与Anthropic Fable 5.1价格区间相当。

Brockman认为token价格已不适用于比较模型,因为OpenAI的token与竞争对手不同,甚至在不同自家模型间也不可比。他强调重要的是每完成一个任务的成本,并称OpenAI已开始测试基于任务的定价。在DeepSWE v1.1上,Astra的顶级配置将每任务估算API成本比Sol降低约57%。

  • OpenAI同时更新了Codex编码环境。新实验性功能允许模型在长会话中跨多个上下文窗口记笔记,此前版本的上下文窗口保持可搜索,即使未记录在案,Astra也能查找之前消息中的需求或测试结果。未来几周该功能将成为默认设置。

信息来源

The Decoder AI原始来源