开源Artificial Analysis·原文 2026年9月7日本站收录 2026年9月8日

OpenBMB发布MiniCPM5-2B:2.6B参数密集推理模型,4B以下开源模型中智能指数最高

MiniCPM5-2B在Artificial Analysis Intelligence Index v4.2上得15分,超越Granite 4.2 3B(11分),但落后于Ling 3.0 Tiny(16分)。

OpenBMB发布了MiniCPM5-2B,一个2.6B参数的密集推理模型,文本输入输出,Apache 2.0许可。在Artificial Analysis Intelligence Index v4.2上,该模型得15分,是总参数低于4B的开源模型中得分最高者,比Granite 4.2 3B(11分)高4分,比Ling 3.0 Tiny(16分)低1分,而Ling 3.0 Tiny的总体参数约为其3倍。

MiniCPM5-2B的上下文窗口为131k tokens,仅支持文本输入,权重可在Hugging Face上获取(Apache 2.0)。OpenBMB是MiniCPM系列高效小模型的开源AI团队。

代理能力在同尺寸模型中领先

MiniCPM5-2B的代理能力是其在该尺寸下的优势。在GDPval-AA v2测试中,它达到Elo 831,领先Ling 3.0 Tiny(718)约110分,领先Granite 4.2 8B(647)约180分。在τ³-Banking测试中,它以21%的成绩与Ling 3.0 Tiny并列第一,优于Granite 4.2 8B(8%)。

在AA-Briefcase评估中,MiniCPM5-2B的Elo为438,在对比模型中排名第二,高于Granite 4.2 8B(324),略低于Ling 3.0 Tiny(485)。AA-Briefcase是Artificial Analysis的代理知识工作评估。

知识、代码和长上下文是短板

MiniCPM5-2B在部分测试中表现较弱。在Humanity's Last Exam中得分9%,在对比集中排第7,落后于Gemma 4 12B(Reasoning)的16%。在Terminal-Bench v2.1上,它得分9%,排第8,而Qwen3.5 9B(Reasoning)得29%。在CritPt上,它得0%。

在SciCode测试中,MiniCPM5-2B得分26%,在五个测量模型中排第二,落后于Granite 4.2 8B(31%)。在AA-LCR v1.1上,它得分59%,在对比集中排第5,低于Ling 3.0 Tiny(60%)。在GDP.pdf(专业文档推理评估)中,它直接通过1%的任务,低于gpt-oss-20b(high)的2%。

在AA-Omniscience测试中,MiniCPM5-2B的得分为-12,原因是它倾向于弃答而非追求准确性。它只尝试了29%的问题,非幻觉率为78%,准确率为8%,低于Ling 3.0 Tiny(9%)和Qwen3.5 9B(Reasoning,16%)。

相对于推理模型的token效率

MiniCPM5-2B在智能指数任务中平均每个任务使用19k输出tokens,与Granite 4.2 3B(19k)并列对比模型中最低。Ling 3.0 Tiny则使用了56k tokens,约为其3倍,以换取高1分的指数得分。MiniCPM5-2B的输出tokens中,有11k为推理tokens。输出tokens的使用量对2.6B模型瞄准的端侧和边缘部署至关重要。

信息来源