百度发布文心5.0:2.4万亿参数原生全模态大模型,文本图像音频视频联合建模
该模型采用统一自回归网络与“下一组Token预测”任务,将文本、图像、音频和视频映射至共享符号空间,实现跨模态理解与生成的端到端优化。
AI解读:这条新闻的核心不是又出了一个参数更大的模型,而是百度在架构上换了一条路:文心5.0不再像多数多模态模型那样,在语言模型外面拼一个图像或音频解码器(后融合),而是把所有模态都当作一串Token,用同一个骨干网络、同一个预测任务去做理解和生成。好处是跨模态的关联不再靠表层转换,而是模型在内部直接学到语义对齐,比如给一段视频配文字说明或生成音频时,上下文能真正跨模态贯通。代价是训练2.4万亿参数的算力负担,百度用两个办法化解:一是混合专家架构按Token动态路由,每个Token只激活约3%的参数,算力接近小型稠密模型;二是“Once-For-All”弹性训练,一次训练后可以抽出不同深度、宽度和稀疏度的子模型,免去为每个部署场景重新训练。对开发者而言,这意味着未来可能用一个统一的API就能同时开车载语音助手、图像生成和视频理解,而不用再拼装多个专用模型;不过,这些能力目前基于百度官方博客和arXiv技术报告,尚无独立第三方评测或详细基准表,实际效果需等模型开放后验证。普通用户眼下不需要做任何事,产品如何跟进、何时可用都不在发布信息范围内。
百度ERNIE团队发布技术报告,介绍新一代基础模型文心5.0(ERNIE 5.0)。百度称这是一款2.4万亿参数的原生全模态大模型,核心变化是把文本、图像、音频、视频放进同一个自回归网络训练,而不是在语言模型外面另接专用解码器。
百度描述,文心5.0将所有模态映射到共享符号空间,用统一的“下一组Token预测”(Next-Group-of-Tokens Prediction)做端到端优化。文本部分沿用标准的下一Token预测(NTP)并辅以多Token预测(MTP)提升吞吐;图像采用“下一帧与尺度预测”(NFSP),把图像当作单帧视频,从而同时学习空间和时间表征;音频使用“下一编解码预测”(NCP),按语义到声学细节的层次逐级建模。
据百度介绍,该模型技术报告已提交至arXiv(编号2602.04705),训练依托自研深度学习框架飞桨。
架构与效率:<3%激活率的超稀疏MoE与弹性训练
为控制万亿参数模型的推理成本,文心5.0采用混合专家(MoE)架构,特点是“模态无关路由”:专家不做人为的视觉、文本等划分,而是直接按Token特征动态分配。百度称,该架构下每个Token只激活约3%的参数,将计算成本压到“与小型稠密模型相当”的水平。
另一项技术是弹性训练(Once-For-All):在训练中随机跳过若干网络层(弹性深度)、限制参与计算的专家规模(弹性宽度),并通过可变Top-k路由调节推理成本(弹性稀疏度)。百度称,这种一次训练得到的超网络能即时导出不同规模的子模型,不必为每种部署场景重新训练。
- 预训练语料:数万亿Token,UTF-16BE编码;混合配对数据(图文、视文)与交错序列数据。
- 训练与上下文长度:上下文窗口从8K扩展至128K;采用阶段式推进,配合防止单一模态主导梯度更新的稳定性技术。
- 后训练管线:包含使用U-RB(无偏回放缓存)处理长尾样本、MISC与WPSM机制缓解熵崩塌并聚焦难例,以及AHRL(自适应提示强化学习)用逐步退出的思维骨架提示引导稀疏奖励任务。
评测声明:多模态理解与生成称达到新SOTA
百度在报告中给出了评测结论,但没有列出具体数值表(技术报告文中只标注了表1至表8,未附数据)。按百度的说法:文本能力方面,在知识储备、逻辑推理、代码、指令遵循和智能体工具调用上表现强劲;多模态理解在多样化基准上展示出卓越性能;高保真图像和视频生成“处于行业领先”;音频理解(如TUT2017任务)达到业界最佳,文本转语音具备有竞争力的表现。
需注意,这些均为百度自述。报告摘要称文心5.0“在多样化的基准测试中树立新的SOTA标准”,并列出“表1/表2(预训练/后训练对比)”“表3(多模态理解)”“表5/表6(图像/视频生成)”“表7/表8(音频理解/文本转语音)”,但正文未附具体得分与对比对象。
- 引文信息:Wang Haifeng等,题为“ERNIE 5.0 Technical Report”的论文已在arXiv预印本库上线(编号2602.04705)。