Meta发布Muse Spark 1.3:智能指数升至62,多项Agentic基准创最佳
Muse Spark 1.3(xhigh)在Artificial Analysis Intelligence Index上得61分,与GPT-5.6 Sol(max)和Grok 4.6(high)持平,且每任务成本仅0.55美元,为该指数59分以上模型中最低。
AI解读:Meta在五个月内第四次更新Muse Spark系列,这次1.3版本的核心提升集中在agentic任务(即让模型自主完成多步骤工作)上。根据Artificial Analysis的独立测试,xhigh变体在Tau3-Bench Banking(模拟银行知识工作)上比上一代跳升12个百分点,max变体更以52%的成绩登顶该基准。对开发者而言,最实际的信号是成本:xhigh定价不变,每百万token输入1.25美元、输出4.25美元,但每个智能任务的平均成本仅0.55美元,是所有得分59+模型中最低的,比同分的GPT-5.6和Grok 4.6便宜约40%。这意味着在不牺牲智能水平的前提下,批量处理agentic任务的账单会明显更小。不过要注意,xhigh在长文本回忆(AA-LCR)和综合知识(AA-Omniscience)上有小幅退步,后者是因为模型更频繁地选择不回答,从而降低了幻觉率。max版本目前仅向Meta合作伙伴限量预览,价格未公布,其更高分数主要靠多算62%的推理token换来。如果你正在做成本敏感的agent工作流,xhigh值得测试;如果只是普通问答,这次升级未必值得切换。
Meta发布了Muse Spark 1.3,这是五个月内Muse Spark系列的第四次重大版本更新。根据Artificial Analysis的独立评测,旗舰变体Muse Spark 1.3(xhigh)在Artificial Analysis Intelligence Index上得61分,较8月的Muse Spark 1.2(57分)提升4分,较7月的Muse Spark 1.1(53分)提升8分。该指数用于衡量模型综合智能水平,xhigh变体与GPT-5.6 Sol(max)、Grok 4.6(high)和Claude Opus 5(high)并列,仅次于Claude Fable 5.1(max,66分)、Claude Opus 5(max,63分)和Claude Fable 5(max,62分)。
限量预览的max变体得分更高,但价格未公布
Muse Spark 1.3(max)目前处于限量预览阶段,仅向Meta的合作伙伴开放,其Artificial Analysis Intelligence Index得分为62分,仅次于Claude Fable 5.1和Claude Opus 5(max)。该变体的高分主要得益于在agentic评估中的额外提升:Tau3-Bench Banking得分52%(xhigh为47%),GDPval-AA v2 Elo达到1754(xhigh为1709)。Meta尚未公布max变体的公开定价。
Agentic能力大幅提升,科学推理同步增强
Muse Spark 1.3(xhigh)在多项agentic基准上较Muse Spark 1.2有显著进步:Tau3-Bench Banking得分从35%升至47%(+12分),Terminal-Bench 2.1得分从80%升至85%(+5分),GDPval-AA v2 Elo从1615升至1709。Muse Spark 1.3(max)进一步在Tau3-Bench Banking上取得52%的成绩,成为该基准所有模型中的最高分。max变体通过消耗更多推理token获得更高分数——在GDPval-AA v2上比xhigh多推理62%,在Tau3-Bench Banking上多28%。
- 科学推理方面,xhigh变体在CritPt上较Muse Spark 1.2提升8分(从18%到26%),GPQA Diamond提升4分(从90%到94%),Humanity's Last Exam提升2分(从45%到47%),SciCode提升3分(从56%到59%)。
- Muse Spark 1.3(max)在科学推理上与xhigh大致相当:Humanity's Last Exam提升2分,GPQA Diamond持平,但CritPt低1分。
少数基准出现轻微退步,主要源于更多弃答
两个变体在AA-LCR(长上下文回忆)上均较Muse Spark 1.2下降4分(从83%到79%)。在AA-Omniscience(准确率)上,xhigh下降3分(从45%到42%),max下降1分(从45%到44%)。Artificial Analysis指出,AA-Omniscience的分数下降是由于模型弃答率(对不确定问题不回答)升高,这同时也降低了xhigh变体的幻觉率。
成本与可用性:xhigh变体为同智能水平最经济选择
Muse Spark 1.3(xhigh)定价与Muse Spark 1.2相同:每百万输入token 1.25美元,输出token 4.25美元,缓存命中输入0.15美元/百万。按Artificial Analysis Intelligence Index计算,xhigh每个任务成本为0.55美元,是该指数59分及以上模型中最低的。相比之下,同分的GPT-5.6 Sol(max)为0.95美元/任务,Grok 4.6(high)为0.94美元/任务,溢价超过70%。成本较Muse Spark 1.2(0.40美元/任务)上升,主要由于agentic评估中每任务输入token增加约57%,输出token仅增加约8%。
- 上下文窗口:100万token,与Muse Spark 1.2一致。
- 输入模态:文本、图像、视频。
- 可用性:通过Meta的第一方API和Muse Code提供(xhigh变体)。
- max变体因未公布定价,不参与成本比较。