百度发布文心大模型5.1 Preview,登顶LMArena文本榜国内第一
百度ERNIE-5.1-Preview在LMArena文本榜排名国内第一、全球第十三,参数压缩至原版约1/3,预训练成本仅为同规模模型的6%。
AI解读:百度在4月30日公布了ERNIE-5.1-Preview的LMArena排名。模型竞技场是开发者常用的第三方能力对比平台,模型能在文本榜排到国内第一、全球第十三,说明文心系列在通用文本能力上有了可对标的成绩。这个版本最大的动作是把模型总参数压缩到文心5.0的三分之一、激活参数压缩到二分之一,预训练成本只花了同规模模型的6%左右。对想用国产模型做应用的团队来说,这直接关系到部署和调用成本——参数变小意味着推理时对显卡的要求降低,同样硬件下可以服务更多请求,模型在API调用价格上也可能有下调空间。数学排全球第九、法律与政府排第一,说明这代模型把能力重点放在了具体行业场景上,做法律文书处理或金融分析类应用的开发者可以优先试用这些方向的评测效果。目前百度公布的是评测排名和架构改进,还没给出公开benchmark的详细数据或商用价格,普通用户暂时不需要行动,但准备选型的企业可以把这版当作文心系列的一个候选来测自己的业务集。
4月30日,LMArena公布最新排名。百度文心大模型ERNIE-5.1-Preview位列LMArena文本榜国内第一、全球第十三。
垂类排名方面,ERNIE-5.1-Preview在法律与政府居全球第一,商业、管理与金融运营排全球第四,软件与信息技术服务排第七,数学排第九。
参数压缩与训练成本
百度称,ERNIE-5.1-Preview继承文心5.0的预训练基础能力,将总参数压缩至约三分之一,激活参数压缩至约二分之一,预训练成本约为业界同规模模型的6%。
官方发布渠道与后续计划
百度表示,该模型得益于分离式全异步强化学习技术和规模化智能体后训练技术,在基础能力、效价比与创作能力上均实现升级。模型体验入口为文心一言官网。
百度称未来将继续推进技术开放合作,但未在公告中披露ERNIE-5.1-Preview的具体评测样本数、API价格或商用发布时间。