Hugging Face Transformers 5.17.0发布:新增HYV4、VibeVoice、NeoMME等模型支持
更新加入Hy4-Preview 780B MoE模型、阿里Fun-ASR-Nano语音识别等六个新模型,并统一视觉旋转嵌入、优化生成性能。
AI解读:这次Transformers 5.17.0最大的亮点是接入了Hy4-Preview——一个 7800 亿参数的MoE语言模型,但每次只激活 490 亿参数,上下文窗口达 100 万token。对开发者来说,有了官方支持就不用自己拼装MLA、稀疏注意力这些复杂结构,直接用Transformers接口跑就行。不过要注意,实现里没包含MTP层,投机解码得靠其他运行时。
同批还收录了阿里FunAudioLLM的Fun-ASR-Nano(800M参数,支持中英日及七种中文方言,自带标点和热词定制),以及Moonshot的KimiLinear线性注意力架构。模型支持变多,但Transformers内部也在做清理:视觉旋转嵌入统一到一个模块,带自定义视觉模型的老代码得迁移,否则可能不兼容。
这次没有太多让普通用户立刻行动的变化。如果你在用Transformers做推理,升级后生成时每步同步减少、不会无故下载远程文件,速度上会有轻微改善;如果你维护着自定义视觉模型或旧版的旋转嵌入逻辑,升级前最好核对一下是否需要改代码。
Hugging Face于 2 月 25 日发布Transformers 5.17.0,加入六个新模型支持,包括Moonshot AI的Hy4-Preview、H Company的NeoMME和阿里FunAudioLLM的Fun-ASR-Nano,并统一视觉旋转嵌入(RoPE)实现,属于破坏性变更。
新模型加入:从千亿MoE到轻量语音识别
HYV4支持Hy4-Preview,780B参数MoE模型(每个token激活 49B),上下文 1M token,每层有 256 个路由专家和 1 个共享专家。它结合MLA、DeepSeek稀疏注意力等特性,但实现不执行MTP层。
Fun-ASR-Nano是由阿里DAMO学院FunAudioLLM团队开发的 800M参数端到端语音识别模型,据称在中英日基准上达到领先水平,支持 7 种中文方言和热词定制,并输出原生标点。
其他新增:VibeVoice多说话人语音合成框架、NeoMME多模态编码器、KimiLinear混合线性注意力架构、NVIDIA Canary-1B-v2语音识别模型。
破坏性变更与改进
破坏性变更:视觉旋转嵌入统一为中央RoPE模块,自定义视觉模型需迁移至新的 `modeling_rope_utils.py`。
改进包括:避免每步解码同步加速器、修复生成时无条件下载远程文件等。
缓存和量化方面修复了VibeVoice量化缓存问题。