模型百度ERNIE·2026年9月5日

百度发布文心 5.1:参数压缩至 5.0 的约 1/3,预训练成本约为同规模模型的 6%

百度称文心 5.1 在Arena搜索榜获国内第一、全球第四,Agent能力超越DeepSeek-V4-Pro,推理得分接近Gemini 3.1 Pro。

AI解读:百度今天正式上线文心 5.1,核心卖点是在接近旗舰模型能力的同时,把训练和推理成本大幅压了下来。据官方数据,它的总参数只有文心 5.0 的三分之一左右,激活参数约一半,预训练算力成本约为业界同规模模型的 6%。这主要靠两项技术:一是从文心 5.0 单次预训练生成的"子模型矩阵"中提取最优结构,省去为不同规模重复预训练;二是用分离式全异步强化学习架构,把训练、推理、奖励等子系统解耦,各自独立扩缩容,并配合FP8低精度训练压低成本。对开发者或企业来说,这意味着用更低成本获得接近顶尖闭源模型的能力——比如在Arena搜索榜上它排全球第四、国内第一,在数学竞赛AIME26中用工具得分 99.6,仅次于Gemini 3.1 Pro。不过,这些成绩都来自基准测试或百度内部评测,实际使用效果和推理成本下降幅度还需要在真实场景中验证。普通用户现在就能在文心一言官网体验,想在自己应用里接入的开发者可以去星河社区Playground试试。

百度于 5 月 8 日正式发布文心 5.1,称其总参数量压缩至文心 5.0 的约 1/3,激活参数约 1/2,预训练算力成本仅为业界同规模模型的约 6%,同时宣称实现同级别基础效果领先。

文心 5.1 基于文心 5.0 训练,通过提取 5.0 子模型矩阵中的最优子结构并采用Once-for-All弹性训练框架,在单次预训练中动态采样优化多个子模型,从而在弹性深度、宽度和稀疏度三个维度实现压缩与扩展。

百度称,文心 5.1 在 5 月 9 日以 1223 分获得Arena搜索榜全球第四、国内第一;在 τ³-bench和SpreadsheetBench-Verified Agent评测中性能超越DeepSeek-V4-Pro,Agent能力接近领先闭源模型。

在GPQA和MMLU-Pro评测中,文心 5.1 效果接近领先闭源模型;内部评测显示其创意写作能力接近Gemini 3.1 Pro;在AIME26(使用工具)数学竞赛评测中得分 99.6,仅次于Gemini 3.1 Pro。

技术架构与成本优化

文心 5.1 采用分离式全异步强化学习基础设施,以RL Controller为核心,将训练、推理、奖励和智能体循环四个子系统的控制面解耦,各子系统可独立部署、扩缩容并匹配最优算力,形成自然流水线以支持长程Agentic RL训练。

为减少强化学习中的训推偏差,百度基于飞桨实现统一FP8低精度算子库,并优化了Rollout Router Replay (R3) 技术,通过两阶段计算–通信掩盖和动态比特位压缩,宣称在训练耗时几乎不增加的情况下使KL散度下降 50%。

后训练阶段采用四阶段流程:统一SFT、领域专家模型并行训练(代码、推理、智能体)、以多教师在线策略蒸馏(OPD)融合专家能力、最后进行通用对话场景的在线强化学习。百度解释,对高熵任务(如开放式聊天)不使用蒸馏,而是通过在线RL保持生成多样性。

创作能力与平台上线

百度强调文心 5.1 在创意写作、长篇叙事和专业文本中表现突出,称已获创作类企业和专业作家的正面反馈。

文心 5.1 于发布当日起陆续上线ISEKAI ZERO、Mulan AI、谛听幻流、Storymaster等数十个创作生产Agent平台。用户可通过文心一言官网(yiyan.baidu.com)对话体验,星河社区同步开放Playground入口。

查看原图 · 2048 × 2048
查看原图 · 2490 × 1732
查看原图 · 1136 × 426

信息来源

百度ERNIE原始来源