Artificial Analysis发布智能指数v4.2:新增AA-Briefcase与GDP.pdf评测,40%权重采用私有测试集
Anthropic的Claude Fable 5.1领跑指数,OpenAI的GPT-6 Astra紧随其后;新增评测覆盖多周知识工作项目与4592页长文档推理,私有测试集权重翻倍以防止刷分。
AI解读:AI模型评测机构Artificial Analysis在模型快速迭代的压力下,将原计划用于v5版本的部分内容提前到v4.2发布,核心是把评测从静态问答推向更接近真实工作的智能体任务。新增的AA-Briefcase要求模型完成跨数周、涉及数千个源文件的项目型知识工作,GDP.pdf则让模型在4592页的专业文档中跨文本、表格、图表和脚注综合证据,这两项测试都使用私有试题集,且私有测试集在总权重中的占比从v4.1的约20%提高到40%,以减少模型厂商针对公开题目训练刷分。当前结果中,Anthropic的Claude Fable 5.1在总指数上领先,OpenAI的GPT-6 Astra在GDP.pdf上得分最高(33.2%),并在输出token效率上接近前沿最优——这意味着企业客户在选择模型时可以更清楚地知道:如果任务涉及长文档分析或多步骤代理工作,GPT-6 Astra和Claude Fable 5.1这类模型仍有明显优势;而评测权重向私有测试倾斜后,厂商声称的分数将更难通过记忆题海获得,普通用户可更信任榜单差异反映的是真实能力差距。
Artificial Analysis于2025年发布智能指数(Intelligence Index)v4.2,将原计划v5版本的部分更新提前落地,以应对近几周前沿模型快速迭代带来的评测滞后问题。v4.1版本发布于数月前,v4版本在2025年1月推出(注:原文发布于2025年,但具体月份未明,按8个月推算为1月)。
v4.2的核心变化包括:新增AA-Briefcase(智能体知识工作评测)和GDP.pdf(长上下文文档推理评测),两者均采用私有留出测试集;将私有测试集权重从v4.1的约20%提升至40%;改进评分基础设施,增强评测鲁棒性。同时,GPQA Diamond(一项高难度科学推理评测)因已被模型“刷满”而移除。
新增评测:AA-Briefcase与GDP.pdf
AA-Briefcase是Artificial Analysis自研的评测项目,使用私有留出测试集,由行业专家设计复杂项目场景,考察模型在真实智能体知识工作任务中的表现。评测模拟持续数周的知识工作项目,每个项目包含多个关联任务和数千个输入源文件。评分结合量规(rubric)与成对比较(pairwise grading),评估可验证的任务完成度、分析质量和呈现质量,以衡量模型在知识工作中的整体智能体能力。
GDP.pdf由Surge AI创建,用于评测单轮专业文档推理能力。测试覆盖100份PDF、十个领域,共4592页,模型需要综合分散在文本、表格、图表、脚注和排除条款中的证据。回答由1275条专家撰写的原子化标准评分,标题指标“All-pass Rate”仅在任务满足所有标准时才计为通过。
AA-Briefcase结果:Claude Fable 5.1和Opus 5领先,随后是GPT-6 Astra和Muse Spark 1.3。GPT-6 Astra较GPT-5.6 Sol有约85 Elo分的显著提升。GDP.pdf结果:OpenAI的GPT-6 Astra以33.2%的All-pass Rate领先,GPT-5.6 Sol以28.2%紧随其后,Claude Fable 5.1以26.2%位列第三。
权重调整与评分基础设施升级
v4.2中,指数总权重的40%来自私有留出测试集,是v4.1的两倍。留出数据包括AA-Briefcase、AA-Omniscience和CritPt的解法。Artificial Analysis表示,这降低了实验室针对评测刷分的可能性,并计划在v5中进一步提高留出测试集占比。
评分基础设施方面:在AA-LCR v1.1中增加了评分系统提示词,修正了答案键中的错误和歧义,提高评分准确性;对GDPval-AA v2和AA-Briefcase改进采样并重新锚定Elo量表,使评分在新模型加入时更稳定;对SciCode改进评分沙箱的鲁棒性,避免正确但运行较慢的代码被误判为失败。
此外,Artificial Analysis明确表示,v4.2是临时更新,v5仍在开发中,未来将推出更多增量发布。v5的规划已进行了数月,v4发布至今约8个月。
主要结果:Anthropic与OpenAI领先
总指数排名中,Anthropic的Claude Fable 5.1位居第一,OpenAI的GPT-6 Astra紧随其后,较GPT-5.6 Sol有4分的提升。Meta位列第三,随后是SpaceXAI、Moonshot/Kimi、Z.AI和Google。
在“Cost per Task”帕累托前沿上,Anthropic、OpenAI、Meta和Z.AI四家实验室并列。在输出token效率方面,GPT-6 Astra比接近智能前沿的几乎所有其他模型都更高效。Claude Fable 5.1、Grok 4.5和Gemini 3.5 Flash-Lite位于该曲线的两端(排除了指数低于25的模型)。