Hugging Face Transformers v5.16.1发布,首次支持GLM-5.3-Flash多模态模型
新版本将GLM-5.3-Flash集成到Transformers库中,该模型拥有 3200 亿总参数和 18B活跃参数,并采用稀疏与线性注意力结合的混合架构。
AI解读:这次发布的重点是让Transformers用户能直接加载和运行GLM-5.3-Flash。它是一款采用混合注意力架构的原生多模态模型,总参数 320B、活跃参数仅 18B,据称在编码和智能体基准上接近Claude Opus 4.8,推理成本比GLM-5.2低一个数量级。对开发者而言,这意味着无需等待厂商专属SDK,就能通过熟悉的Transformers API调用这一模型进行微调或部署;对使用MoE模型的企业,活跃参数少加上稀疏注意力能显著降低长上下文场景的显存占用和推理成本。不过,目前公开信息主要来自官方发布说明,尚缺乏第三方基准验证,实际性能提升还需在自身任务上测试确认。普通读者无需立即行动;相关开发者可评估该模型是否符合编码、多模态或智能体任务的需求。
Hugging Face于近日发布Transformers库v5.16.1,这是一个包含GLM模型支持的特供版本。据发布说明,该版本新增了GLM-5.3-Flash模型支持(PR #48342),并包含两项小型修复。GLM-5.3-Flash被描述为GLM-5系列中首个原生多模态模型,拥有 320B总参数和 18B活跃参数,据称在基准测试和真实负载中优于GLM-5.2,且成本为其十分之一,编码和智能体基准接近Claude Opus 4.8。
核心更新:GLM-5.3-Flash集成
根据Hugging Face的发布说明,GLM-5.3-Flash基于新训练的基座模型,架构和训练方案针对能力与效率重新设计。该模型首次在GLM系列中引入混合架构,结合稀疏注意力和线性注意力,宣称可大幅降低长上下文服务成本,同时保持精确的长上下文能力。此外,模型采用流形约束超连接(mHC)以提升扩展效率。这些改进配合最新的 30T token多模态预训练语料,据称可实现用更少计算获得更高智能。
- 新增GLM-5.3-Flash支持(PR #48342),文档见Hugging Face Transformers官方模型文档。
- 参数:总 320B,活跃 18B,架构为混合稀疏/线性注意力。
- 性能声明:优于GLM-5.2,成本为其十分之一;编码和智能体基准接近Claude Opus 4.8(数据来源:发布说明,未经第三方验证)。
小型修复
v5.16.1还包含两项补丁:恢复张量并行(TP)API的向后兼容性(PR #48300),以及修复ESMFold2的内核提交和仓库路径(PR #48186)。其中TP兼容性修复针对的是行为兼容性问题,内核路径修复则与安全相关。
- 恢复TP API向后兼容性(@ArthurZucker)
- 修复ESMFold2的内核提交和仓库路径(@Rocketknight1)