研究The Decoder AI·原文 2026年9月6日

Artificial Analysis更新智能指数至 4.2 版,调整GPT-6 Astra评分并新增两项基准测试

在GPT-6 Astra评分引发质疑后,Artificial Analysis发布Intelligence Index v4.2,将Astra的得分调整为高于前代模型 4 分,同时加入AA-Briefcase和GDP.pdf两项新基准。

AI解读:Artificial Analysis这次更新核心是回应外界对GPT-6 Astra评分偏低的质疑:此前多项评测(包括OpenAI自己)都显示Astra领先明显,但该机构只给了它与前代持平的分数,引发公信力危机。v4.2里Astra比前代Sol高 4 分,但仍排在Anthropic的Claude Fable 5.1之后,位列第二。对普通用户来说,这个榜单变化不改变任何工具选择——你更该关注它新增的AA-Briefcase和GDP.pdf基准,前者测真实知识工作、后者测PDF文档分析,直接反映模型在办公场景的表现;如果这两项分数比综合排名更能说明问题,你选模型时可以单独参考。该机构同时把私有测试数据权重提到 40%,目的就是防止厂商针对公开题刷分,这对所有评测使用者都意味着更高的可信度。需要明确的是,榜单只是参考,OpenAI等其他评测仍显示Astra遥遥领先,具体差异原因尚未公开。

Artificial Analysis已发布其Intelligence Index 4.2版,据The Decoder报道,此举可能是为了回应其基准测试未能捕捉GPT-6 Astra实际进展的批评。此前多项评估(包括OpenAI自家的评测)均显示Astra大幅领先其他模型。

在更新后的指数中,GPT-6 Astra的得分比其前代模型高出 4 分。Anthropic的Claude Fable 5.1仍居榜首,Astra位列第二,Meta的模型排名第三。

该指数新增了两项基准测试:AA-Briefcase(用于评估真实世界知识工作能力)和Surge AI的GDP.pdf(用于PDF文档分析)。GPQA-Diamond因模型已解决而被移除。

Artificial Analysis表示,为防止刷分,私有测试数据目前占权重 40%。该公司还修复了多项基准评分错误,并调整了评分系统以保证结果稳定。

评分调整与排名变动

新版指数发布前,Artificial Analysis对Astra的评分与其他评测机构的结论相矛盾。Epoch AI将Astra排在 267 个模型中的第一位,分值为 169 分,测评覆盖了 50 多个基准;ARC-AGI-3的测试则显示,根据所用测试环境的不同,Astra有大幅或非常大的进步。而Artificial Analysis最初只给Astra与前代持平的分数。

更新后,Astra较其前代Sol提升 4 分,此前两个OpenAI模型的分数持平。据Artificial Analysis称,Astra每项任务使用的token数量低于其他所有前沿模型。

新增基准与测试改进

v4.2中引入的新基准AA-Briefcase针对现实世界知识工作,GDP.pdf来自Surge AI,用于PDF文件分析。GPQA-Diamond因为已被现有模型解决而退役。

为防止厂商针对公开测试数据训练,私有测试数据权重提高到 40%。此外,新版本修复了若干基准的评分错误,并调整了评分系统以确保结果更稳定。

更新原因与后续计划

Artificial Analysis称,它推迟更新是为了在重大模型发布期间保持分数稳定,但排行榜头部变动太快,不得不进行临时更新。据The Decoder报道,该公司表示v5已开发八个月,将分阶段推出。

信息来源

The Decoder AI原始来源