百度开源ERNIE-4.5-VL-28B-A3B-Thinking多模态模型,3B激活参数支持图像思考与工具调用
模型采用MoE架构,仅激活30亿参数,在视觉推理、STEM推理等任务上接近旗舰模型表现,并新增Think with Image模式,可自主调用图像放大与搜索工具。
AI解读:百度开源的ERNIE-4.5-VL-28B-A3B-Thinking是一款多模态思考模型,总参数280亿但每次只激活30亿,属于MoE架构。它最特别的地方是引入了强化学习(GSPO和IcePop策略)来训练可验证的视觉推理任务,并新增了“Think with Image”模式——模型在回答前可以像人一样放大图片局部或调用图像搜索来确认细节,比如案例中它通过放大功能读出了蓝底标牌上的“HOTEL BUZA”字样,或通过搜索识别出毛绒玩具是名创优品的Dundun形象。这意味着对于需要细看图表、电路图、视频帧或长尾物品识别的用户,模型不再只靠内部知识硬猜,而是能主动获取外部视觉信息。模型按Apache 2.0协议发布,可商用,支持transformers、vLLM和FastDeploy部署,也能用ERNIEKit做SFT微调。对开发者来说,本地部署门槛主要在于显存:vLLM单卡需80GB,FastDeploy也要求至少80GB,量化版可尝试更低配置。目前百度公开了基准测试表现和一些演示案例,但没有给出完整评测报告或与其他模型在同一基准上的对比数据,实际效果仍需自行验证。普通用户暂时不用做什么,这套能力要跑起来需要较高硬件投入。
百度文心团队宣布开源多模态模型ERNIE-4.5-VL-28B-A3B-Thinking。据百度官方博客介绍,该模型在ERNIE-4.5-VL-28B-A3B架构基础上,通过中期训练引入大规模视觉-语言推理数据,并采用GSPO与IcePop策略的强化学习,以及动态难度采样来提升推理能力和训练稳定性。模型总参数量280亿,属于MoE(混合专家)架构,每次推理仅激活30亿参数。模型按Apache License 2.0协议发布,允许商业使用。
核心能力:视觉推理、STEM、定位、图像思考与视频理解
据百度博客,模型在视觉推理上可进行多步分析、图表解读与因果推理,官方称其表现可与Gemini-2.5-Pro相媲美;STEM推理可解决图片中的物理和数学问题,官方示例展示了计算桥式电路等效电阻(结果为7/5Ω)的完整推理过程。视觉定位(Grounding)能力针对社区反馈做了增强,支持在工业场景输出结构化坐标;官方示例显示模型能检测图中所有穿西装的人并输出bbox_2d坐标的JSON结果。
- 图像思考(Thinking with Images):模型可调用图像放大和图像搜索工具。官方示例中,模型通过放大蓝底标牌识别出文字“HOTEL BUZA”,通过搜索识别出黄色卡通小鸡为名创优品(MINISO)的Dundun毛绒玩偶形象。
- 工具使用:模型具备工具调用能力,可即时使用图像搜索等外部工具,覆盖长尾视觉知识。
- 视频理解:具备时间感知与事件定位能力。官方示例中,模型能从视频中提取字幕及时间戳,并识别出约17秒、37秒、47秒处为桥上拍摄片段。
部署与微调方式
百度博客提供了四种使用路径:使用transformers库加载模型(需指定trust_remote_code);通过vLLM主分支的夜间版本运行推理,官方建议单卡80GB显存,如遇错误可添加--gpu-memory-utilization 0.95重试,并支持--reasoning-parser和--tool-call-parser参数以启用思考与工具调用解析;使用FastDeploy快速部署服务,支持量化(wint8),单卡部署至少需要80GB显存;以及使用ERNIEKit(基于PaddlePaddle)进行指令微调(SFT、LoRA)和对齐训练(DPO)。
- Hugging Face模型ID:baidu/ERNIE-4.5-VL-28B-A3B-Thinking。
- 官方还提供ERNIEKit配置示例(如run_sft_lora_8k.yaml用于LoRA微调,run_sft_8k.yaml用于Function Call微调)。