研究The Decoder AI·原文 2026年9月4日本站收录 2026年9月7日

GPT-6 Astra在ARC-AGI-3上超越人类平均效率,Chollet提前AGI时间表

OpenAI的GPT-6 Astra在ARC-AGI-3基准上首次以低于人类中位数的步数完成任务,ARC Prize联合创始人François Chollet称进展速度超出预期两倍,并将其AGI预测提前。

OpenAI的GPT-6 Astra在ARC-AGI-3基准上取得62.7%的得分,首次以高于人类平均的效率解决陌生游戏环境中的任务。ARC Prize联合创始人François Chollet在X上表示,这套模型“比预期快约两倍”地解决了该基准,并回答其AGI预测“更早”(Sooner),但未提供具体年份。

ARC-AGI-3表现与效率:超越人类中位数步数

ARC-AGI-3测试将AI放入规则和目标未知的游戏世界,要求模型通过试错自行探索。GPT-6 Astra在内部ARC harness下达到62.7%的得分,测试成本约26,000美元,而其前代GPT-5.6 Sol仅得7.78%,Claude Opus 5为30.16%。OpenAI报告中的99.9%得分是在其自定义harness下产生,该harness保留了推理链并自动摘要长序列,ARC Prize测量显示,相比内部harness,这一设置在167个双方都解决的游戏推理对中快3.66倍、少用49%的token。ARC Prize仅将62.7%视为厂商间公平比较的数据,并计划未来也公布厂商harness的数值。

  • 在标准ARC scaffold上,成本从无推理时的49,791美元降至最大推理时的26,098美元,得分从35.2%升至62.7%;ARC Prize解释原因是Astra用更少的移动步骤解决了游戏,从而减少模型调用次数。
  • 一个特例是:推理级别设为“低”时得分为17.5%,低于无推理的35.2%,ARC Prize未解释此异常。
  • 人类测试者每90分钟获得115美元加每解一题5美元,约9次尝试折算每局约12.78美元;若仅计算大脑代谢能量,ARC Prize换算为每局0.067美分。

模型符号化行为与自创简写系统

ARC Prize观察到,Astra在标准设置中自主创建了类似代数的速记系统,记录对象、坐标、规则和开放计划,例如“extend8 to3; retract10 to2”。Chollet将其描述为“高效、即时的符号化世界建模”,并称模型会“开发出自己的简写DSL来表示游戏内状态”,本质上是“特定游戏的代数记法”。ARC Prize在早期与第三方开发的PRO-LONG agent框架配合时(作为红队测试伙伴),Astra可在沙盒中执行代码,并编写了游戏棋盘解析器、路径查找、战斗规则模块等库,但ARC Prize未观察到任何逃离沙盒的行为。这些运行因包含代码解释器和记事本,与人类测试条件不可比,测量的是模型与自建工具的组合性能。

  • ARC Prize指出,Astra的符号化建模行为“此前只在复杂的harness中见过”,因此“harness能力正日益转移到模型本身”。
  • 第三测试环境PRO-LONG运行不纳入人类测试对比,因测试者既无代码解释器也无记事本。

Cholte对AGI的回应与ARC-AGI-4计划

ARC Prize明确不将结果解读为通用人工智能的证据。“我们对系统所知仅限于其基准分数,”Chollet写道。发布ARC-AGI-3时他们强调:“解决它不是AGI的证明,也不是终点线。”该基准虽测试了探索、无指导适应和从稀疏数据进行因果世界建模等定性属性,但规模较小,游戏时间比现实任务短多个数量级,需要更少的数据和模型复杂度。Chollet此前估计ARC-AGI-3会被解决约需一年,Astra因此“快约两倍”到达。当被问及其2030年AGI预测是否仍成立时,Chollet回答:“更快,因为进展比我预期快。”ARC Prize表示,ARC-AGI-4自ARC-AGI-3发布以来一直在开发,计划于2027年第一季度发布,旨在探索递归自我改进和开放式创新等领域。

  • ARC Prize认为ARC-AGI-3本身局限明显:确定性机制、封闭目标,不代表开放现实世界。
  • 你上面的信息仅基于来源文本本身。

基准测试中的分歧与成本差异

不同基准对GPT-6 Astra的评价不一。Epoch AI的ECI总分中Astra以169分领先(Sol 162,Fable 5.1 163,Opus 5 162),但AA Intelligence Index给Astra 61分,与其前代Sol持平,低于Fable 5.1的66分。在编码任务上,Astra在Coding Agent Index得67分,Fable 5.1以70分领先。成本方面,OpenAI对每单位处理文本收费是前代Sol的2.5倍,使任务成本约提高75%;但相比Anthropic,Astra在编码任务上达到与Claude Fable 5同分,而单任务成本低于其一半。Epoch指出,Astra与Fable 5.1目前在不同基础上被测量:Astra在数学、知识和谜题上领先,Fable 5.1几乎在所有编码测试上占优,但Astra的编码得分仅有一次记录,且来自中等推理水平。

  • Astra在FrontierMath Erdős(开放数学问题)上,Epoch AI报告称其是唯一解决68个开放Erdős问题中2个且证明经Lean验证的模型,每次尝试预算300美元;另有3个解决方案来自非标准化额外运行,消耗超过22万美元计算资源,不计入得分。
  • 幻觉率在AA-Omniscience上从92%降至51%,但Astra在GDPval-AA v2上损失约80 Elo点,并在银行支持、SciCode和长上下文推理任务上表现下滑。
  • ARC-AGI-1上Astra在xhigh推理下得98.5%,在max下达97.5%,该基准被认为已大体饱和。

信息来源

The Decoder AI原始来源